2026年9月8日星期二 · 共 10 篇精选

AI 生成的概念插画,非真实研究设施照片。
编辑视角
OpenAI 的研究加速报告给出一个很醒目的数字:研究人员的代理用量,按 API 价格折算,每日中位数超过 600 美元。但这既不是实际账单,也不是效率奖章。真正值得计算的是,把检查、失败重试、实验等待都算进去之后,团队到底更快拿到了什么可以采用的结果。工作量增加,并不保证关键决定也更早到来。
这会改变企业评价自动化的方式。代码行数、token 用量和并行会话很容易统计,一次排除了错误方向的实验却很难定价。比较单位不该只是“一个代理对一个员工工作一小时”,而应是整个流程交出合格结果的成本。如果真正稀缺的是实验设计、硬件资源或审查时间,更快写代码只是把队列推到下一站。看清瓶颈转移,比庆祝活动量增长更重要。
MiniCPM5-2B代表另一种选择:不是所有任务都需要最强的远程模型。对边界明确的工作,本地部署带来的资源可控性和数据掌握权可能更有价值。但“小”也不是免费。长输入、反复尝试、服务维护,都应进入同一本账。UltraData-RL-2609公开了训练材料,却也提醒开发者,拥有数据与拥有可信的训练流程是两件事。
TALA 开源给出更具体的分工思路:让模型表达意图,让专门算法处理约束清楚的步骤。架构设计的关键,不是把所有环节都塞给同一个模型,而是判断哪里需要灵活推理、哪里更适合稳定的规则。小模型配好工具,可能比大模型反复修正输出更实用;这个判断仍要由具体任务来验证。
还有一些成本落在使用者之外。kernel.org 的爬虫记录描述了低效获取方式带来的负担,Internet Archive 的基础设施活动则让长期保存的代价变得可见。模型价格下降,并不会让这些服务器、存储和维护人员消失。值得追求的加速,是整套系统交付更多有用结果,而不是把省下来的工作悄悄转成别人的账单。
研究加速与边界
OpenAI 研究加速:每天 600 美元不等于生产率
译文:代理仍然需要大量人工引导
OpenAI 9 月 6 日披露,到 8 月中旬,研究人员使用代理的每日中位用量按 API 价格折算已超过 600 美元。这不是公司的实际账单,也不是生产率指标。按人工耗时估算为 4—8 小时的成功任务中,超过一半需要干预。实验增加同时伴随着算力增长,不能全部归因于代理。
来源: OpenAI
《An Alien Mind》:监测能力可能成为瓶颈
译文:对监测能力的信心
OpenAI 首席科学家 Jakub Pachocki 在 9 月 6 日文章中指出,对思维链监测的依赖正遇到限制,并主张建立共同安全门槛、加强协调。这是研究负责人的判断,不是递归自我改进已经实现的证明。关键矛盾在于:当研究越来越自动化时,负责监督的机构能否以相近速度改进检查方法。
小模型与可检查的训练材料
MiniCPM5-2B 发布:小模型也提供 128K 上下文
译文:参数总数:2,516,756,480
OpenBMB 9 月 7 日发布 MiniCPM5-2B,面向本地助手与资源受限部署。模型卡列出 131,072 token 上下文、约 25.2 亿总参数,其中非嵌入参数约 19.8 亿,因此名称里的 2B 与托管页的 3B 并不矛盾。榜单成绩来自团队自己的比较范围;小权重也不意味着最大上下文可以低内存运行。
UltraData-RL-2609:85,995 道可检查的训练任务
译文:发布内容包含测试用例,而不是沙箱。
9 月 7 日发布的 UltraData-RL-2609 包含 85,995 道任务,覆盖数学、代码、长上下文与科学知识。它提供明确答案和验证规则,不只是增加数据量。代码部分附有测试用例,但不提供执行沙箱;去污染检查也只覆盖构建时已知的评测集。换用新评测或新训练环境时,仍需重新检查数据重叠并隔离代码执行。
把几何布局交给专门工具
TALA 随 D2 0.9.0 开源:模型摆节点,算法理连线
译文:TALA 仍然负责连线路由
TALA 于 9 月 7 日以 MPL-2.0 开源,随 D2 0.9.0 提供。它允许部分节点固定位置、其余自动布局,模型或作者负责构图,算法负责连线。作者同时说明:新增节点可能明显改变整体布局,大图耗时更长,单向流程图有时更适合 Dagre 或 ELK。开源带来选择权,不代表每张图都会更好看。
开放访问背后的账单
内核维护者:爬虫持续占用 14—16 个核心
译文:为爬虫渲染提交记录
Konstantin Ryabitsev 在 8 月 29 日的运维记录中称,kernel.org 五个节点的 90 个核心里,有 14—16 个持续为爬虫渲染提交页面。Simon Willison 于 9 月 7 日再次引用这份记录。仓库本可直接克隆,逐页生成 HTML 却把成本留给维护者。流量归因是作者判断,不等于逐一确认了每个请求者;获取方式本身就是成本问题。
来源: Konstantin Ryabitsev · kernel.org
Internet Archive 九月配捐:免费访问仍需服务器
译文:你的首笔捐款将获得 2:1 配捐
Internet Archive 在 9 月 1 日的活动公告中称,维护的知识资料已达 210 PB,仍需支付存储、电力、冷却和人员成本。九月新设每月至少 25 美元的定期捐款,首笔可获 2:1 配捐,并非之后每个月都自动翻三倍。免费说的是读者访问价格,不是长期保存和提供资料的实际成本。
来源: Internet Archive
运行自己掌握的软件
Jellyfin 12.0 发布:升级前先确认能恢复
译文:备份是回到旧版本的唯一途径
Jellyfin 9 月 7 日发布 12.0,继续改进数据库、性能以及书籍和漫画支持。首次启动会改写数据,回退需要备份,不能只装回旧程序。10.10.7 或 10.11.x 可作为升级起点,更旧版本需先过渡;仅大小写不同的用户名和未适配插件也可能出问题。自托管带来自主权,同时把升级与恢复责任交给使用者。
旧密码系统的具体边界
1999 年证书密钥耗时 32 小时分解,不是现代 TLS 失守
译文:E-Certify 的 512 位根证书已于 2002 年被 Netscape 移除。
Matthew McPherrin 9 月 7 日记录了一次历史实验:用桌面电脑分别耗时 32 和 29 小时,分解两枚过时的 512 位 E-Certify RSA 根证书密钥。这些证书已于 2002 年被 Netscape 移除,并非现代浏览器信任体系遭到破解。Claude Code 协助提取旧资料及搭建兼容服务,但作者没有保证所有提取记录完全可靠。

图片来源:Matthew McPherrin 的历史实验。画面为 Netscape 4.51,并非现代浏览器。
进入实际业务的天气预报
WeatherNext 3:每小时更新,天气模型进入实际业务
译文:每小时生成天气预报
9 月 3 日公布的 WeatherNext 3 直接利用卫星观测,每小时更新全球预报。DeepMind 列出面向气象站的温湿度 5 公里分辨率,以及风等其他地表变量的 10 公里分辨率,并提供产品和企业数据接入。价值在于更及时的信息能改变哪些实际决策;另行提供的 Weather Lab 属于实验平台,官方预警仍应查看气象机构。
来源: Google DeepMind
2026 年 9 月 8 日 · 使用 AI 辅助研究与写作。引文均标明来源,中文引文为译文。文中的实验及运维数据未由 WindFlash 独立复现。