AI 技术日报:Grok 4.6 与 DeepSeek V4 Pro 0813 重划前沿(2026-08-13)的封面图
In-depth Article

AI 技术日报:Grok 4.6 与 DeepSeek V4 Pro 0813 重划前沿(2026-08-13)

一天之内连发两款旗舰:Grok 4.6 在 Artificial Analysis 智能指数上以 61 分追平 GPT-5.6 Sol,DeepSeek V4 Pro 0813 则以低约一个数量级的价格逼近前沿。这两款产品把 AI 竞赛从「单一王座」变成「价格—能力」曲面。同一天的可靠性研究更戳破幻象:Agent 的「能力主效应」在基准方差中占比不足 3%,榜单测的是特化而非通用智能。应对之道是架构分层——Grok、Qwen3.8-2.4T、DeepSeek 承担长程思考,Nemotron 3.5 Lightning 以 3B 激活参数承接执行;ComBodied Agents 与可验证支付则让这种自主变得可审计。

加载中...
1 min read
Also available:English version

2026年8月13日星期四 · 共 10 篇精选

AI 技术日报封面 2026-08-13


编辑视角

一天之内连发两款旗舰,恰好把 2026 年最核心的问题摊到台面上。

xAI 的 Grok 4.6 在 Artificial Analysis 智能指数上拿到 61 分,在九项基准的综合评分上追平 GPT-5.6 Sol,而且明确为长程 Agent 调优——研究、代码库分析、把模糊想法做成能跑的应用,并在长轨迹里内建自我测试与验证。几乎同一时间,DeepSeek 把旗舰更新到 V4 Pro 0813:1M 上下文,原始能力比 Sol 和 Opus 4.8 低一档,价格却便宜约一个数量级。两款产品讲的是同一件事的两面:前沿不再是一个模型,而是一张「价格—能力」曲面,不同团队正在抢占曲面上不同的点。

这正是当天那篇「可靠性分析」让人后背发凉的原因。研究发现,Agent 的「能力主效应」在主要基准的方差里占比不足 3%——榜单测的是特化与任务对齐,不是通用智能。所以「追平 GPT-5.6 Sol」是有用信号,但只能读作「在这个综合分数上追平」,不能读作「同样能打」。生产环境真正的问题是「部署决策可靠性」:哪一步、用哪个模型、花多少钱、留什么审计。

于是架构开始分层。Grok 4.6、Qwen3.8-2.4T、DeepSeek V4 Pro 0813 承担长程思考;NVIDIA Nemotron 3.5 Lightning 用 3B 激活参数承接高频执行——工具调用、结果校验、子任务分发。ComBodied Agents 把目标再往前推一步:不是改变软件或物理状态,而是建模人的状态、保住人的自主权。而可验证的 Agent 支付(AWS Nitro Enclave 内证明 + 区块链锚定)与英国主权云部署,是把这些自主能力变成受监管企业真正能买单的东西。


基础模型

本栏目聚焦大语言模型的架构演进与前沿突破。近期,超大规模专家混合模型与具备增强智能体推理能力的系统相继问世,标志着基础模型在参数规模与长程逻辑处理上迈入新阶段。这些进展不仅大幅提升了计算效率,更在性能上直追顶尖闭源系统,为下一代通用人工智能的实现奠定了坚实的技术底座。

Qwen3.8-2.4T 发布:拥有 2.4 万亿参数及 95B 激活参数的 MoE 模型

参数量:总计 2.4T,激活参数 95B

上下文长度:原生 262,144,可扩展至 1,010,000 个 Token。

Qwen3.8-2.4T 是一款采用专家混合(MoE)架构的因果语言模型,总参数量达 2.4 万亿,其中推理时激活参数为 95B。该模型在架构上包含 92 层由 Gated DeltaNet 与门控注意力机制组成的混合布局,显著提升了代码编写、专业研究及长程智能体任务的执行可靠性。其原生支持 262,144 个 Token 的上下文长度,并可扩展至 101 万 Token,具备处理超大规模数据的能力。在基准测试中,该模型在 PaperBench 上取得 93.0 分,并在多个智能体任务中展现出极强的自主规划与反馈处理能力。目前模型权重已在 Hugging Face 发布,完全兼容 vLLM 和 SGLang 等主流推理框架,方便开发者集成到现有技术栈中。

来源: Hacker News

xAI 发布 Grok 4.6:增强长程智能体能力,性能持平 GPT-5.6

Grok 4.6 在多项智能体编码和知识工作基准测试中达到了前沿智能水平。

它在 Artificial Analysis 智能指数(九项基准测试的综合评分)上与 GPT-5.6 Sol 持平。

Grok 4.6 在 Artificial Analysis 智能指数中获得 61 分,在九项基准测试的综合评估中已持平 GPT-5.6 Sol。该模型专注于支持长程运行的智能体,能够跨多个步骤执行研究、代码库分析以及将初步构思转化为完整应用等复杂任务。训练过程采用了更长的增量训练运行,利用精心筛选的模型生成推理数据和改进的优化器方案。通过在内核优化和 Web 开发等特定环境下的强化学习,模型在执行长轨迹任务时的自我测试与验证能力显著提升。目前 Grok 4.6 已在 Cursor 和 Grok Build 平台上线,并针对漏洞修复和工程设计等高阶应用场景优化了安全防护机制。

来源: Hacker News

xAI Launches Grok 4.6 Featuring Advanced Agentic Reasoning and GPT-5.6 Level Performance

DeepSeek V4 Pro 0813:以更低成本逼近前沿

deepseek-v4-pro 模型已更新为 DeepSeek-V4-Pro-0813

我们计划在近期上调 DeepSeek API 服务的整体定价,预计涨幅显著。

DeepSeek 已把旗舰模型 deepseek-v4-pro 更新为 0813 版本,同时保留相同的模型标识符,现有 API 调用无需改动即可继续使用。这款 1M 上下文模型在推理与编程上表现强劲——GPQA Diamond 88.8%、τ²-Bench Telecom 96.2%、Terminal-Bench Hard 46.2%——接近但尚未触及前沿。价格才是重点:缓存未命中时输入每百万 Token 0.435 美元,输出每百万 Token 0.87 美元,缓存命中时输入仅 0.003625 美元。Hacker News 上的讨论将其定位为与 Anthropic Opus 4.8 同级相近、但便宜约 20 倍,同时明确弱于 Sol 与 Fable。本次更新仍是纯文本模型,与 DeepSeek 一贯「视觉并非近期 AGI 核心」的判断一致。

来源: DeepSeek

AI 智能体

AI 智能体正从简单的交互工具演变为具备自主推理与执行能力的复杂系统。当前趋势聚焦于英伟达 Nemotron 等高性能专用模型的开发,以及针对安全性、可靠性与以人为本设计的深度优化。随着企业开始在主权云端大规模部署智能体,并引入可验证支付系统等基础设施,AI 智能体正加速迈向成熟的商业自动化应用阶段。

ComBodied Agents:以人为本的 AI 智能体新范式

数字智能体主要转换软件状态,而具身智能体主要转换物理状态;两者都没有将人类不断演变的状态和自主性作为建模的主体。

我们引入了 Combodied Agents,这是一种以人为本的范式,它可以感知、建模、预测并支持随时间变化的个人状态轨迹。

Combodied Agents 提出了一种以人为本的新范式,通过建模个人状态轨迹,将 AI 智能体从单纯的任务执行转向持续的人类福祉。目前的数字智能体侧重于软件状态转换,而具身智能体侧重于物理状态转换,两者都忽略了对人类演变状态和自主权的建模与评估。该框架整合了多模态感知、长时记忆和个人世界模型,将传感器、可穿戴设备和机器人视为行动通道而非终极目标。系统通过目的受限且用户可纠正的表示,在确保隐私和安全的前提下提供按比例、感知共识的支持。这种闭环架构不仅能够预测未来的个人状态,还引入了自主权保护指标和场景化评估,推动了 AI 智能体向更深层的人机协作演进。

来源: HuggingFace Papers

ComBodied Agents: A New Paradigm for Human-Centric Agentic AI

基于概括化理论的 AI 智能体评估可靠性分析

在每个数据集和检查类型中,智能体主体效应占总方差的比例均低于 3%

训练单元可靠性与留出可靠性呈负相关(在 τ² 上 r = -0.90)

研究显示,在三大主流智能体基准测试中,智能体主体效应对总方差的贡献不足 3%,这意味着现有排行榜更多反映的是专业化程度而非通用能力。智能体与任务的交互作用占据了 7-23% 的方差,揭示了性能表现高度依赖特定任务匹配。该研究提出“部署决策可靠性”(DDR)框架,通过四面概括化理论分解方差。实验发现最难任务象限的可靠性会骤降至零,且训练可靠性与留出可靠性呈强负相关(r = -0.90)。这表明在开发中看似稳定的设计在实际复现时可能表现最差。该框架为企业评估和采购 AI 智能体提供了五个维度的防御性决策支持,并将所有代码和数据开源。

来源: arXiv cs.AI

NVIDIA Nemotron 3.5 Lightning:专为 AI 智能体打造的 30B MoE 模型

NVIDIA Nemotron 3.5 Lightning 是一款具有 30 亿活跃参数的开源 300 亿混合专家 (MoE) 模型

为每个执行步骤都使用前沿推理模型会增加成本和延迟。

NVIDIA Nemotron 3.5 Lightning 是一款具有 30 亿活跃参数的 300 亿参数开源混合专家 (MoE) 模型,专门针对全天候 AI 智能体的执行层进行了优化。在处理工具调用、结果验证和子智能体分派等高频任务时,依赖大型前沿推理模型往往会导致极高的成本和延迟。该模型通过提供专门的执行能力,解决了长期运行的 AI 系统在性能与成本之间的矛盾。开发者可以利用此架构在保证任务准确性的同时,大幅提升复杂自动化工作流的吞吐量。NVIDIA 的这一创新旨在通过平衡参数效率与执行性能,进一步加速自主系统在实际工业和软件场景中的落地部署。

来源: NVIDIA Generative AI Blog

NVIDIA Nemotron 3.5 Lightning: A Fast 30B MoE Model for AI Agent Execution

OneAdvanced 在英国主权 AWS 环境部署 50 多个 AI 智能体

通过在 Amazon SageMaker AI 上自主托管 Llama 4 Maverick 和 Llama Guard 4,构建了一个英国主权 AI 平台

使用 Strands Agents SDK 在 Amazon ECS 上构建了 50 多个智能体

OneAdvanced 在英国主权 AWS 平台上成功部署了 50 多个 AI 智能体,以满足严格的区域数据驻留要求。这家企业软件提供商利用 Amazon SageMaker AI 自主托管了 Llama 4 Maverick 和 Llama Guard 4 模型,确保了对大语言模型执行的本地化控制。其技术架构集成了基于 pgvector 构建的检索增强生成(RAG)管道,以提高数据检索的准确性和上下文关联。这些智能体使用 Strands Agents SDK 开发,并托管在 Amazon ECS 上以实现可扩展性能。此次部署为需要在利用公共云基础设施的同时实现主权 AI 能力的组织展示了稳健的框架。通过集成先进的防护栏和向量数据库,OneAdvanced 在主权边界内为各类企业级 AI 应用建立了安全环境。

来源: AWS Machine Learning Blog

OneAdvanced Deploys 50+ AI Agents on UK-Sovereign AWS Infrastructure

Solv Labs 基于 Amazon Bedrock AgentCore 构建可验证的智能体支付系统

每笔交易都在 AWS Nitro Enclave 中经过授权、证明、风险定价,并在结算前锚定到公有区块链。

该模式为企业在监管环境中的自主智能体支付提供了可验证、可审计的追踪路径。

Solv Labs 在 Amazon Bedrock AgentCore payments 上构建了一套受监管的智能体支付工作流,确保每笔交易都在 AWS Nitro Enclave 中通过授权与证明。该架构在结算前对每笔交易进行风险定价,并将其锚定在公有区块链上,为企业提供可验证且可审计的自主智能体支付追踪路径。这种模式专门针对监管环境设计,通过结合安全隔离区技术与区块链,解决了 AI 智能体执行财务操作时的透明度与安全性问题。该方案为企业在部署能够处理真实价值资产的 AI 智能体时,提供了必要的合规性支持与信任基础,展示了生成式 AI 与安全金融结算层结合的落地实践。

来源: AWS Machine Learning Blog

Solv Labs Builds Verifiable Agent Payment Systems Using Amazon Bedrock AgentCore

研究论文

深入探索学术与工业界的前沿研究,涵盖 AI 评估框架与基准测试的最新进展。本栏目聚焦 Apodex Discovery 等验证性评估系统,以及揭示模型空间推理局限的 MindTopo 基准。通过严谨的科研论证,我们得以清晰界定性能边界,为构建具备复杂逻辑与可靠性的智能系统提供关键洞察。

Apodex Discovery:用于验证发现式人工智能的真实场景基准框架

Apodex 在生存力、趋向性、结构预测和生成设计方面,比已发表的现有技术水平提高了 7%。

特定任务的生物医学环境使 GPT-5.5 和 GPT-5.6-sol 的平均归一化预测得分分别提高了 2.5 和 7.6 分。

Apodex Discovery 在 AAV 衣壳设计任务中将现有技术水平提升了 7%,涵盖了生存力、趋向性和结构预测等多个维度。该框架通过集成基础模型、工具和控制策略的“重型求解器”,实现了长期且有状态的可验证调查。研究团队通过对 16 个部门的 561 个行业进行调研,筛选出 20 个高价值现实问题用于首批发布。在药物重定位测试中,特定环境使 GPT-5.5 和 GPT-5.6-sol 的平均预测分数分别提升了 2.5 和 7.6 个点。HDS6 评估系统通过 TRACES 接口独立分析工具使用、修复能力和连贯性,提供了超越最终任务成功率的深度洞察。这一进展推动了人工智能评估从静态基准向复杂科学发现过程的转型。

来源: arXiv cs.AI

MindTopo 基准测试揭示视觉语言模型的空间推理能力

MindTopo 为测试 AI 如何理解拓扑关系设定了新的基准

突显了加强空间推理和规划的新机遇

MindTopo 基准测试为评估视觉语言模型在路径、围栏和绳结等复杂拓扑关系上的理解能力提供了新标准。该工具重点测试人工智能在空间推理与规划方面的表现,揭示了当前模型在处理几何结构和三维关系时的局限性。通过系统性的评估框架,研究人员可以更清晰地识别增强模型空间逻辑的切入点。这些能力的提升对于优化机器人在复杂环境中的导航与任务执行至关重要。MindTopo 的出现为缩小视觉感知与认知推理之间的差距提供了重要参考。未来,该基准将助力开发具备更强空间常识的下一代大模型。

来源: Microsoft Research Blog (current)

MindTopo Benchmark Unveils Spatial Reasoning Limits in Vision-Language Models

开源项目

探索开源软件的演进趋势,关注协作开发与前沿创新的交汇。本栏目追踪重大仓库更新、许可协议变更,以及 AI 辅助编程对项目可持续性的影响。我们深入分析维护者如何调整工作流,以应对 AI 优先的贡献者,在自动化时代确保社区活力与代码质量。带您掌握塑造透明、去中心化技术未来的核心工具与发展哲学。

针对 AI 优先贡献者的开源维护策略调整

AI 贡献者已经出现在你的队列中。

Nicholas Tindle 分享了让维护者保持控制权的仓库指令、准入关卡和边界设置。

AI 贡献者已经出现在项目的提交队列中,这为开源维护者带来了全新的挑战。AutoGPT 维护者 Nicholas Tindle 指出,项目必须调整工作流以应对 AI 生成的代码及交互。为了保持对仓库的控制权,开发者需要实施特定的指令、自动化准入关卡以及明确的界限。这些防御性措施旨在确保维护者在有效过滤噪声的同时,仍能从 AI 辅助贡献的效率中获益。通过规范 AI 智能体与代码库的交互方式,项目可以防止因管理不当的自动化提交而导致的维护者精疲力竭。随着 AI 优先开发逐渐成为主流,这种基础设施的演进对现代软件项目已变得至关重要。

来源: The GitHub Blog

Adapting Open Source Maintenance for AI-First Contributors


本报告由 WindFlash AI 自动生成,内容基于过去 48 小时内的公开 AI 资讯。

广告

Share this article

广告