OpenAI 研究代理日用量折价 600 美元:加速的账单谁来付?|WindFlash 日报的封面图
In-depth Article

OpenAI 研究代理日用量折价 600 美元:加速的账单谁来付?|WindFlash 日报

OpenAI 披露研究代理用量,MiniCPM5-2B 提供本地选择,TALA 开源,公共服务器承担爬取成本。十条技术动态,观察 AI 加速的收益与真实账单。

加载中...
1 min read
Also available:English version

2026年9月8日星期二 · 共 10 篇精选

AI 技术日报封面 2026-09-08

AI 生成的概念插画,非真实研究设施照片。


编辑视角

OpenAI 的研究加速报告给出一个很醒目的数字:研究人员的代理用量,按 API 价格折算,每日中位数超过 600 美元。但这既不是实际账单,也不是效率奖章。真正值得计算的是,把检查、失败重试、实验等待都算进去之后,团队到底更快拿到了什么可以采用的结果。工作量增加,并不保证关键决定也更早到来。

这会改变企业评价自动化的方式。代码行数、token 用量和并行会话很容易统计,一次排除了错误方向的实验却很难定价。比较单位不该只是“一个代理对一个员工工作一小时”,而应是整个流程交出合格结果的成本。如果真正稀缺的是实验设计、硬件资源或审查时间,更快写代码只是把队列推到下一站。看清瓶颈转移,比庆祝活动量增长更重要。

MiniCPM5-2B代表另一种选择:不是所有任务都需要最强的远程模型。对边界明确的工作,本地部署带来的资源可控性和数据掌握权可能更有价值。但“小”也不是免费。长输入、反复尝试、服务维护,都应进入同一本账。UltraData-RL-2609公开了训练材料,却也提醒开发者,拥有数据与拥有可信的训练流程是两件事。

TALA 开源给出更具体的分工思路:让模型表达意图,让专门算法处理约束清楚的步骤。架构设计的关键,不是把所有环节都塞给同一个模型,而是判断哪里需要灵活推理、哪里更适合稳定的规则。小模型配好工具,可能比大模型反复修正输出更实用;这个判断仍要由具体任务来验证。

还有一些成本落在使用者之外。kernel.org 的爬虫记录描述了低效获取方式带来的负担,Internet Archive 的基础设施活动则让长期保存的代价变得可见。模型价格下降,并不会让这些服务器、存储和维护人员消失。值得追求的加速,是整套系统交付更多有用结果,而不是把省下来的工作悄悄转成别人的账单。


研究加速与边界

OpenAI 研究加速:每天 600 美元不等于生产率

译文:代理仍然需要大量人工引导

OpenAI 9 月 6 日披露,到 8 月中旬,研究人员使用代理的每日中位用量按 API 价格折算已超过 600 美元。这不是公司的实际账单,也不是生产率指标。按人工耗时估算为 4—8 小时的成功任务中,超过一半需要干预。实验增加同时伴随着算力增长,不能全部归因于代理。

来源: OpenAI

《An Alien Mind》:监测能力可能成为瓶颈

译文:对监测能力的信心

OpenAI 首席科学家 Jakub Pachocki 在 9 月 6 日文章中指出,对思维链监测的依赖正遇到限制,并主张建立共同安全门槛、加强协调。这是研究负责人的判断,不是递归自我改进已经实现的证明。关键矛盾在于:当研究越来越自动化时,负责监督的机构能否以相近速度改进检查方法。

来源: Jakub Pachocki · OpenAI

小模型与可检查的训练材料

MiniCPM5-2B 发布:小模型也提供 128K 上下文

译文:参数总数:2,516,756,480

OpenBMB 9 月 7 日发布 MiniCPM5-2B,面向本地助手与资源受限部署。模型卡列出 131,072 token 上下文、约 25.2 亿总参数,其中非嵌入参数约 19.8 亿,因此名称里的 2B 与托管页的 3B 并不矛盾。榜单成绩来自团队自己的比较范围;小权重也不意味着最大上下文可以低内存运行。

来源: OpenBMB · model card

UltraData-RL-2609:85,995 道可检查的训练任务

译文:发布内容包含测试用例,而不是沙箱。

9 月 7 日发布的 UltraData-RL-2609 包含 85,995 道任务,覆盖数学、代码、长上下文与科学知识。它提供明确答案和验证规则,不只是增加数据量。代码部分附有测试用例,但不提供执行沙箱;去污染检查也只覆盖构建时已知的评测集。换用新评测或新训练环境时,仍需重新检查数据重叠并隔离代码执行。

来源: OpenBMB · dataset card

把几何布局交给专门工具

TALA 随 D2 0.9.0 开源:模型摆节点,算法理连线

译文:TALA 仍然负责连线路由

TALA 于 9 月 7 日以 MPL-2.0 开源,随 D2 0.9.0 提供。它允许部分节点固定位置、其余自动布局,模型或作者负责构图,算法负责连线。作者同时说明:新增节点可能明显改变整体布局,大图耗时更长,单向流程图有时更适合 Dagre 或 ELK。开源带来选择权,不代表每张图都会更好看。

来源: Alexander Wang · D2

开放访问背后的账单

内核维护者:爬虫持续占用 14—16 个核心

译文:为爬虫渲染提交记录

Konstantin Ryabitsev 在 8 月 29 日的运维记录中称,kernel.org 五个节点的 90 个核心里,有 14—16 个持续为爬虫渲染提交页面。Simon Willison 于 9 月 7 日再次引用这份记录。仓库本可直接克隆,逐页生成 HTML 却把成本留给维护者。流量归因是作者判断,不等于逐一确认了每个请求者;获取方式本身就是成本问题。

来源: Konstantin Ryabitsev · kernel.org

Internet Archive 九月配捐:免费访问仍需服务器

译文:你的首笔捐款将获得 2:1 配捐

Internet Archive 在 9 月 1 日的活动公告中称,维护的知识资料已达 210 PB,仍需支付存储、电力、冷却和人员成本。九月新设每月至少 25 美元的定期捐款,首笔可获 2:1 配捐,并非之后每个月都自动翻三倍。免费说的是读者访问价格,不是长期保存和提供资料的实际成本。

来源: Internet Archive

运行自己掌握的软件

Jellyfin 12.0 发布:升级前先确认能恢复

译文:备份是回到旧版本的唯一途径

Jellyfin 9 月 7 日发布 12.0,继续改进数据库、性能以及书籍和漫画支持。首次启动会改写数据,回退需要备份,不能只装回旧程序。10.10.7 或 10.11.x 可作为升级起点,更旧版本需先过渡;仅大小写不同的用户名和未适配插件也可能出问题。自托管带来自主权,同时把升级与恢复责任交给使用者。

来源: Jellyfin · release team

旧密码系统的具体边界

1999 年证书密钥耗时 32 小时分解,不是现代 TLS 失守

译文:E-Certify 的 512 位根证书已于 2002 年被 Netscape 移除。

Matthew McPherrin 9 月 7 日记录了一次历史实验:用桌面电脑分别耗时 32 和 29 小时,分解两枚过时的 512 位 E-Certify RSA 根证书密钥。这些证书已于 2002 年被 Netscape 移除,并非现代浏览器信任体系遭到破解。Claude Code 协助提取旧资料及搭建兼容服务,但作者没有保证所有提取记录完全可靠。

来源: Matthew McPherrin

Netscape 4.51 certificate viewer — screenshot from Matthew McPherrin’s experiment

图片来源:Matthew McPherrin 的历史实验。画面为 Netscape 4.51,并非现代浏览器。

进入实际业务的天气预报

WeatherNext 3:每小时更新,天气模型进入实际业务

译文:每小时生成天气预报

9 月 3 日公布的 WeatherNext 3 直接利用卫星观测,每小时更新全球预报。DeepMind 列出面向气象站的温湿度 5 公里分辨率,以及风等其他地表变量的 10 公里分辨率,并提供产品和企业数据接入。价值在于更及时的信息能改变哪些实际决策;另行提供的 Weather Lab 属于实验平台,官方预警仍应查看气象机构。

来源: Google DeepMind


2026 年 9 月 8 日 · 使用 AI 辅助研究与写作。引文均标明来源,中文引文为译文。文中的实验及运维数据未由 WindFlash 独立复现。

广告

Share this article

广告