AI 技术日报:智能体支架之争(2026-08-21)的封面图
In-depth Article

AI 技术日报:智能体支架之争(2026-08-21)

英伟达报告其 AVO 智能体在 ARC-AGI-3 上获得 100% 成绩,并明确把语言模型称为整个智能体系统中的一个组成部分;AWS 则将 OpenAI GPT-5.6 系列接入 Amazon Bedrock,通过跨区域推理覆盖超过 25 个区域。EnvHarness、Zetta 和 AI4AI-Bench 三篇研究进一步把环境与训练流程本身变成可编程基础设施。与此同时,arrayref 的仿冒依赖包在编译阶段执行恶意代码,Anna’s Archive 借 Anthropic“巴拿马计划”披露批评扫描后销毁纸质书的数据获取方式。竞争不只发生在模型之间,也发生在支架、供应链和数据来源上。

加载中...
1 min read
Also available:English version

2026年8月21日星期五 · 共 10 篇精选

AI 技术日报封面 2026-08-21


编辑视角

今天最值得注意的数字不是又一个跑分。NVIDIA 宣布其 AVO 智能体在 ARC-AGI-3 上拿到 100%,但文章第一句话就把重点说清楚了:前沿语言模型只是 AI 智能体的一个组成部分。真正决定成败的是外围的 harness——它管理上下文、调用工具、维护状态、处理失败。AWS 从另一个方向给出同样的判断:OpenAI GPT-5.6 系列进入 Amazon Bedrock,通过跨区域推理覆盖超过 25 个区域。模型正在变成公用设施,竞争的重心转向把工作调度到模型的那个层。

研究也在收敛到同一个目标。EnvHarness 用可编程插件层包住静态训练环境,让环境随智能体的进步而调整;Zetta 在机器人执行过程中实时进化运行时控制器,因为对物理系统来说,回合结束后的反思已经太迟;AI4AI-Bench 则问得更远——智能体能否自己设计训练算法,把“递归自我改进”变成可测量的任务。这三项工作的共同点是:被工程化的不再只是权重,还包括支架本身。

同一天的新闻也提醒我们地基有多薄。仿冒的 proc-macro1 依赖包让 arrayref 0.3.10 变成编译期恶意代码,crates.io 随后才移除相关版本;Anna’s Archive 则借 Anthropic“巴拿马计划”的和解披露批评“买书—扫描—销毁”的数据获取方式。你可以不同意它的全部结论,但它指出的现实很难回避:智能体栈越宏大,越依赖少数人控制的供应链与数据来源。


AI 智能体

AI 智能体正从静态模型向具备长程规划能力的自主系统演进。英伟达 AVO 等突破显著提升了复杂推理表现,而 Zetta ζ 等框架则推动了具身智能的自我进化。随着企业级应用的规模化,行业重心正转向建立标准化的安全信任架构,并通过 EnvHarness 等动态环境插件提升训练效率,实现更灵活且可扩展的自动化工作流。

英伟达 AVO 在 ARC-AGI-3 基准测试中达 100%,推动长程自治智能体发展

前沿语言模型只是 AI 智能体的一个组成部分。

周围的智能体系统——通常被称为 harness——决定了模型如何接收上下文、使用工具、维护状态、响应反馈

NVIDIA AVO 在 ARC-AGI-3 基准测试中取得了 100% 的满分成绩,展示了用于长程自治智能体的尖端通用架构。该系统架构被称为“harness”,负责管理上下文、工具使用和状态维护。它通过解决模型如何响应反馈以及从故障中恢复,确保在复杂长任务中的可靠性。通过专注于进度持续性,该架构使语言模型能在长程操作中高效运行。这一进展标志着在创建具备自主问题解决能力的智能体方面迈出了重要一步。该框架证明了智能体周边逻辑与核心模型在实现 AGI 过程中同样关键。

来源: NVIDIA Generative AI Blog

NVIDIA AVO Hits 100% on ARC-AGI-3, Advancing Long-Horizon Autonomous Agent Systems

EnvHarness:通过可编程插件层将静态环境转变为动态智能体训练场

EnvHarness 是一个由插件组件组成的可编程层,它可以封装静态环境以重塑其行为。

环境是手工构建且静态的:无法识别智能体的弱点,并随着智能体的进步而迅速落后。

EnvHarness 引入了一个由插件组件组成的可编程层,旨在不修改核心代码的情况下封装并重塑静态环境的行为。目前的 LLM 智能体训练通常依赖于手工构建的静态环境,这些环境无法感知智能体的特定弱点,也难以随着智能体的能力提升而进化。传统的环境生成方法往往需要昂贵的验证器或特定领域的流程,给工程实现带来了沉重负担。通过采用这种包装器方法,该框架允许研究人员根据学习需求动态修改环境行为。该系统有效减轻了从零开始重建复杂环境的需求,同时保留了原始模拟逻辑的完整性。这一进展标志着自主 AI 系统正向更灵活、更具自适应性的评估基准迈进。

来源: HuggingFace Papers

EnvHarness: A Programmable Layer for Dynamic Agent Environment Learning

Zetta ζ:面向自我进化物理智能的高效闭环具身框架

现有框架大多保持开环状态,在执行过程中遵循固定技能,且仅在回合完成后进行反思。

物理交互要求决策能追踪快速变化的机器人与环境状态,其频率超出了当今大型智能体模型的能力。

现有的具身智能体框架大多采用开环学习模式,仅在任务完成后进行反思,无法应对物理交互中快速变化的环境状态。这种事后反思机制受限于大型模型较低的处理频率,难以实时管理复杂的执行过程。Zetta 推出了一种闭环具身框架,通过演化基于代码的运行时控制器来实现自我进化的物理智能。该系统能够将高层逻辑推理与实时物理执行相结合,使机器人能够在执行过程中动态调整行为。通过利用代码生成的灵活性,Zetta 有效解决了传统端到端策略模型在复杂物理任务中的局限性。这种方法为实现更具适应性的机器人控制提供了新的技术路径。

来源: HuggingFace Papers

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

NVIDIA 定义 AI 智能体技术栈的安全与信任架构

NVIDIA 的 AI 安全团队提出了对新兴智能体技术栈的看法,包括各层的作用

随着 AI 智能体能力增强并运行更久,在应用中构建安全与信任变得日益重要。

NVIDIA AI 安全与安全团队基于 NVIDIA OpenShell 及生态合作成果,提出了对新兴 AI 智能体技术栈的深度见解。随着 AI 智能体处理任务能力的提升和运行周期的延长,在应用层构建安全与信任机制已成为核心架构需求。该框架详细界定了技术栈中各层级在保障系统可靠性与风险防控方面的具体职责。通过与开源项目和开发者的紧密协作,NVIDIA 旨在为复杂代理化工作流建立标准化的安全准则。这一视角为开发者在构建长周期运行的自主系统时,提供了管理安全风险和增强系统透明度的实践指南。

来源: NVIDIA Generative AI Blog

NVIDIA Defines Security and Trust Architecture for Emerging AI Agent Stacks

AI4AI-Bench:评测大模型智能体在递归自我提升中的算法设计能力

递归自我提升(RSI)探讨的是 AI 系统是否能够改进其自身的生产过程。

因此,RSI 是否可行取决于智能体是否能够设计训练算法。

AI4AI-Bench 是首个专门用于评测大模型智能体在递归自我提升(RSI)中设计训练算法能力的基准测试。该基准关注 AI 系统能否改进自身的生产过程,即通过优化训练目标或更新规则来提升后续版本的计算能力交换率。目前主流的评估套件大多侧重于数据收集或超参数调优,而 AI4AI-Bench 填补了隔离测试智能体算法创新能力的空白。这一研究对于探讨 AI 实现自主迭代和递归自我提升的可行性具有重要意义。通过测量训练过程中的结构性变化,该工具为评估智能体自主优化其底层生产机制提供了标准化手段。

来源: ArXiv

企业级 Agentic AI 规模化:模式设计与去供应商锁定

在企业中扩展 agentic AI 需要能够在保持灵活性的同时避免供应商锁定的模式。

机器学习团队在框架、模型和提供商的“多元化”环境中运行着许多 agentic AI 系统。

企业在扩展 Agentic AI 系统时正面临由多种框架、模型和提供商组成的复杂“多元化”环境。保持架构灵活性是防止供应商锁定的核心,这要求机器学习团队在部署多个智能体系统时采用标准化的操作模式。多智能体系统在异构环境中的协同工作需要遵循特定设计原则。通过实施可互操作的模式,组织可以确保 AI 投资具备可移植性,能够灵活应对未来的技术变革。这些策略为 ML 团队在不绑定特定供应商的情况下,大规模管理和协调众多智能体系统提供了路径。实现这些模式有助于企业在快速演进的 AI 生态中保持长期竞争优势。

来源: AWS Machine Learning Blog

Scaling Agentic AI: Enterprise Patterns and Vendor Flexibility

基础模型

基础模型是当前生成式人工智能的核心支柱,涵盖了大型语言模型及多模态系统的最新进展。本板块重点关注模型架构的突破、规模法则的演进,以及支撑大规模模型部署与推理的关键基础设施。从跨区域算力调度到全新的性能基准,我们为您呈现塑造人工智能未来的核心技术动态与行业趋势。

Amazon Bedrock 为 OpenAI GPT-5.6 模型推出跨区域推理功能

Amazon Bedrock 现已在超过 25 个 AWS 区域通过跨区域推理提供 OpenAI GPT-5.6 模型(Sol、Terra 和 Luna)。

了解美国地理和全球推理配置文件如何路由请求以实现更高的吞吐量

Amazon Bedrock 现已在超过 25 个 AWS 区域通过跨区域推理功能提供 OpenAI GPT-5.6 模型(包括 Sol、Terra 和 Luna)。该功能引入了美国地理区域和全球推理配置文件,通过动态路由请求来实现更高的吞吐量。开发者可以使用 OpenAI API 或 Converse API 调用这些模型,并能灵活配置 IAM 权限、配额管理及监控系统。跨区域推理能够帮助企业克服单一区域的容量限制,并提供更强的系统可用性。此次更新进一步扩展了 AWS 的基础模型库,并为企业级生成式 AI 应用提供了更灵活的扩展能力。

来源: AWS Machine Learning Blog

AWS Bedrock Adds Cross-Region Inference for OpenAI GPT-5.6 Models

编程技术

深入探讨软件开发的演进,关注编程语言、开发工具及开源生态系统的安全动态。本栏目涵盖从语言漏洞(如编译时恶意代码)到框架更新的核心资讯,旨在帮助开发者在保障安全的前提下提升效率。通过追踪最新的技术趋势与供应链威胁,我们为您提供构建稳健代码所需的关键洞察。

恶意 Rust Crate arrayref 在编译时执行恶意负载

0.3.10 版本增加了一个名为 proc-macro1 的仿冒 crate 依赖,其构建脚本在项目编译时下载并运行远程二进制文件。

crates.io 团队随后删除了这些恶意版本。

热门 Rust crate arrayref 的 0.3.10 版本遭到破坏,通过名为 proc-macro1 的仿冒依赖项引入了编译时恶意软件。该恶意依赖项由冒充 David Tolnay 的账户发布,会在项目编译过程中从远程服务器下载并执行特定架构的二进制文件。此次攻击利用了维护者 droundy 被盗的账户,影响了包括 internment 0.8.7 和 append-only-vec 0.1.9 在内的多个项目。payload 通过重新组合 Base64 编码的 URL 片段来规避检测,并连接到指挥中心。尽管 crates.io 已删除恶意版本,但此事件突显了编译时代码自动执行带来的严重供应链风险。

来源: Hacker News

Malicious Rust Crate arrayref Executes Build-Time Malware

AI 政策与伦理

随着人工智能迅猛发展,其治理框架与社会影响正面临严峻审视。本栏目聚焦技术进步、法律监管与道德问责,探讨从数据获取伦理到版权保护等核心议题。我们将持续关注政策制定者如何在创新与公众利益间寻求平衡,共同应对自动化时代的复杂挑战。

AI公司被指大规模销毁纸质书籍:通过垄断物理资源训练私有模型

Anthropic的“巴拿马计划”在15亿美元的版权和解案中被曝光。

该公司斥资数千万美元购买了数百万本纸质书,扫描并训练其 Claude 模型,然后将其全部销毁。

多家AI公司被指正在大规模收购二手纸质书,在完成扫描获取训练数据后将其彻底销毁,以获取2022年之前未受机器污染的知识。Anthropic的“巴拿马计划”据称涉及15亿美元的版权协议,通过销毁纸质书来防止竞争对手获取相同数据并规避法律风险。这种做法导致人类知识被永久锁定在私人服务器中,剥夺了公众获取这些资源的权利。安娜档案馆警告称,到2025年AI生成内容将占据互联网半壁江山,人类文明的原始载体正面临灭顶之灾。为此,该机构呼吁全球志愿者参与大规模扫描计划,抢在书籍被AI巨头销毁前实现数字化共享,建立“数字亚历山大图书馆”。

来源: Hacker News

AI Companies Accused of Destroying Millions of Physical Books to Train Models

研究论文

深入探索人工智能与计算机科学领域的最新学术突破,汇集全球顶尖研究成果。本栏目聚焦前沿论文,如 4DAnyone 展现的单目视频 4D 人体建模技术,解析科研背后的创新逻辑与方法论。通过解读理论研究如何驱动技术进步,我们为您呈现数字孪生、计算机视觉及智能交互的未来图景。

4DAnyone:基于单目视频实现高质量 4D 人体建模

4DAnyone,一个从未经校准的单目视频中重建 4D 人体的框架

当目标视图超过单个 DiT 前向传递的容量时,必须将它们分成几组

4DAnyone 框架支持通过未经标定的单目视频重建高质量 4D 人体模型,并将其转化为 4D 高斯泼溅(4DGS)表示。该研究指出了现有摄像机控制视频扩散模型在生成数十个目标视图时难以保持一致性的问题,并将其定义为“受限注意力上下文问题”。当目标视图超过单次 DiT 前向传播容量时,视图分组会导致输出不一致,而 4DAnyone 通过解决这一瓶颈实现了重建级的多视图一致性。这种方法消除了对复杂多摄像机阵列或预标定设备的依赖,大幅降低了动态人体建模的门槛。最终生成的 4DGS 模型可实现动态人物的真实回放和任意视角合成。

来源: ArXiv


本报告由 WindFlash AI 自动生成,内容基于过去 48 小时内的公开 AI 资讯。

广告

Share this article

广告