2026年9月5日星期六 · Astra 专题 · 十个有来源的观察角度

封面由内置生图工具生成,是概念插画,并非官方产品截图。
编辑视角
Astra 发布后,最值得追问的已经不只是“答得准不准”,而是“交回来的东西,究竟能不能用”。一个可以操作软件、修改文件、接受中途反馈并继续做事的模型,应该用完成工作的标准来评判,而不是只看一段漂亮回答。本期是 9 月 5 日的 Astra 专题,围绕 9 月 3 日发布后的资料展开十个角度,并不把同一次发布包装成十条独立新品新闻。
ARC Prize 的测试提醒我们,模型名字背后还有运行条件。能保留什么信息、怎样调用工具、允许花多少预算,都会影响最终结果。把最高分搬进标题,却不交代这些条件,读者就很容易把一整套系统的成绩,误认为换一个模型就能得到的收益。对团队来说,该比较的是完整工作流程,而不只是模型下拉框里的两个名字。
Legora 的文件核对和 Playco 的游戏原型提供了更实在的验收方向:前者留下可以逐项检查的记录,后者要接受真正游玩的检验。它们仍是合作方披露的案例,不能直接代表所有客户的效果;但至少告诉我们,试用时应当索取什么证据,而不是只问“你做好了吗”。
建筑可视化演示又把这件事往前推了一步。可编辑的项目比一张效果图更有用,不过,“能打开”与“设计正确”仍是两回事。平面关系、模型细节、漫游体验,各有各的检查标准。不能因为最后一个镜头很漂亮,就跳过前面的判断。
我们的判断是:先拿一组真实任务做对照,把合格条件写在开始之前。除了耗时和费用,还要记录人工改了多少、哪些结果最终没被接受。特别值得加入两种情况——任务中断后续做,以及中途修改要求。它们更接近日常协作,也更容易暴露“看似一直在做,实际已经偏题”的问题。
Astra 系统卡则给这些演示补上另一半:能力越强,未经检查的操作后果也越大。验收标准应当随之提高。需要的不是更长的解释,而是能看见成果、能核对过程,并确认它始终没有越出用户要求的范围。
发布与开放
Astra 操作电脑:提速数字来自模拟测试
译文:在 OSWorld 2.0 的延迟模拟中
OpenAI 在 9 月 3 日发布 Astra,公布的 OSWorld 2.0 成绩为 72.6%,每项任务约 40 分钟;Sol 为 65.7%、约 75 分钟。这里测的是延迟模拟,不是我们实测的办公效率。它的意义在于把完成质量和耗时放在一起看,但不能据此承诺所有工作都快一半。
来源: OpenAI
Astra 开放进度:有人已用上,入口仍不一致
译文:看起来 Astra 正在向 Pro 账号开放。
一位 Pro 用户发帖称已收到 Astra,评论里有人只能在 Work/Codex 使用,也有人称普通聊天已出现。这些反馈说明开放正在推进,却不能证明所有账号同步开通。官方发布采用分批开放的表述;实际能否使用,还要看自己的入口与工作区设置。
怎样读测试结果
ARC Prize:62.7% 与 99.9% 不是同一种测试配置
ARC Prize 公布的标准运行框架最高分是 62.7%(max),加入供应商适配器后最高为 99.9%(high)。适配器保留不透明的推理状态并支持上下文压缩;标准框架也能留下笔记,并非完全没有记忆。这是两类配置各自的最高成绩,不是固定推理强度的对照实验。只报 99.9%,就漏掉了支撑成绩的运行条件。
来源: ARC Prize · 独立评测
长任务的接入与成本
Astra API 价格:要算交付成本,不只看单价
模型页面列出 105 万 token 上下文,标准输入、输出价格分别为每百万 token 10、50 美元。但单次输入超过 27.2 万 token 后,整次请求的输入按 2 倍、输出按 1.5 倍计价。未触及该门槛时,10 万输入加 1 万输出的算例为 1.50 美元,未计工具和重试。不能把大上下文容量直接乘以基础单价;还要算交付后的人工修补成本。
Astra 开发指南:等待工具时,也能继续独立工作
译文:应用仍然负责执行工具,并管理待完成的工作。
Astra 支持异步工具调用和任务进行中的指令调整。应用仍需负责执行工具、管理尚未结束的工作。比较合理的用法是:等文件载入时先整理结构,但不能在文件还没回来时下结论。用户中途改了要求,也应当影响后续操作,而不只是让下一条回复换个说法。
专业工作的复核
Legora 核账:单项接近 40%,整体平均约 3%
译文:在 BAR 的全部任务中,平均提升约为 3%。
Legora 称,Astra 在数分钟内核对了 41 份文件,找出全部四处预埋错误。财务报表核对这一项接近 40% 的提升,不能替代其 BAR 全部任务平均约 3% 的结果。这是 OpenAI 发布的合作方案例,不是独立审计报告。对使用者而言,可逐项复核的检查记录,比一句“已经检查完”更有价值,最终判断仍由专业人员负责。
来源: OpenAI
游戏与可编辑场景
Playco 游戏原型:人工修补减少,性能检查不能省
译文:一个赛博朋克版本需要修复性能问题
Playco 通过连接 Unity、Godot 等引擎的 Playbot 制作原型,称人工修补减少 50%;其中一个赛博朋克版本仍需要修性能。这个合作方案例说明尝试创意的成本可能下降,不等于生成结果已经适合正式发行。验收不能停在画面好看:还得实际玩一遍,检查操作、帧率和会不会卡住。
来源: OpenAI
建筑可视化:能编辑、能漫游,不等于能施工
译文:这仍然是一个可视化项目
Thomas Ricouard 在 9 月 4 日展示了用 Astra 制作可编辑 Blender 房屋,再探索 Unreal Engine 5 漫游的过程。第一版主要是起居亭,并非完整住宅;扩建前先审查了平面布局。这是官方演示,不是独立横向测评。更值得借鉴的是验收次序:先看房间怎么连接,再检查模型,最后体验漫游。漂亮效果图不等于施工设计通过审查。
安全与可检查性
Astra 安全说明:能力提升,也增加了监测负担
译文:对所有使用工具的推理加入失准行为监测
OpenAI 将 Astra 列为旗下首个达到 Critical 网络安全能力级别的模型,并称对外部署中所有使用工具的推理都加入了失准行为监测。这是能力评估和防护措施的说明,不是发生真实攻击的证据。落到产品上,需要回答的是:代理能做哪些操作,哪些要人确认,出错后有没有可追查的记录。
来源: OpenAI
Astra 系统卡:推理可控性不能读成欺骗率
在推理长度为 750—1,250 token 的 CoT-Control 测试中,Astra 遵守针对自身推理的约束的比例为 60.9%,Sol 为 16.1%。它测的是模型控制推理表述的能力,不是“欺骗用户的概率”。OpenAI 也报告了对抗指令下的监测局限。因此,解释听起来合理,不能代替检查实际操作和最终成果。
来源: OpenAI · 系统卡
整理日期为 2026 年 9 月 5 日(北京时间)。本专题依据 9 月 3 日发布资料、9 月 4 日演示、当前文档和社区反馈,并补充 9 月 2 日 ARC 测试背景。引文标注为译文的部分译自所链接原文;分析属于编辑判断,WindFlash 未自行运行文中模型评测。