2026年7月29日星期三 · 共 10 篇精选

编辑视角
今天 AI 圈最热闹的事,不是又一个万亿参数模型,而是 OpenAI Codex 负责人 Tibo(@thsottiaux)又一次按下了额度重置键。他给所有 ChatGPT Work 和 Codex 用户补满配额,并解释 GPT-5.6 Sol 为什么把额度吃得比预期快:模型更愿意长时间干活、多调工具、在 code mode 里并行跑流程;同一档 High 推理也比 GPT-5.5 更费 token;中位数用户其实还好,真正被掏空的是啃硬活的长尾重度用户。团队说典型场景续航大概能多撑约 18%,明天还要把调查期间暂停的五小时限额加回来——后者立刻引来一片「求你别恢复」的回复。
更有意思的是,Tibo 重置本身已经长成一种亚文化。社区里有人喊 Lord Tibo、重置侠;有人做 Codex Radar、Tibo Reset Radar,盯他推文预测下一次「圣恩」;有人在额度见底前狂开 Ultra/fast,把「等 Tibo」写进日程。连 Tibo 自己都自嘲:「有一天我们做了重置按钮,然后历史就被改写了。」Sam Altman 更早发过「这条推如果有 1 个赞,Tibo 就重置」的玩笑帖。对比 Claude 用户抱怨吃限额时很少有对等的「按一下就满」神话,Codex 这边的运维手势被仪式化了:它既是产品补偿,也是社区情绪的泄压阀,还是一种近乎 meme 的身份认同——你会不会刷新 Tibo 的时间线,本身就成了「重度 Agent 用户」的暗号。
这背后藏着更硬的结构性问题:Agent 能力与 token 效率不同步。Sol 更会协调子代理、等工具、搜网页,这些正是让它好用的原因,也是账单爆炸的原因。中位数指标好看、长尾被榨干,说明上线前的成本模型按「普通会话」估,没按「整夜自主编程」估。与此同时,Kimi K3 把 2.8T 参数开源权重丢上桌面,Claude Mythos 用 60 小时把 HAWK 密钥强度砍半,GPQA 一类榜单被审计出约 12% 坏题——一边是闭源 agent 的用量政治与社群神话,一边是开源规模与评估诚信的回潮。工程师真正该盯的,不是下一次重置几点到,而是:你的工作流是在烧额度刷存在感,还是在用 Prefactor 这类评估层、真实任务和可验证基准,把「能力跃迁」收成可控系统。
开发者工具
当 Agent 真正进入日常编程,额度、重置与可观测性不再是运维细节,而是开发体验本身。从 Tibo 的一键补满到供应链安全加固,开发者工具正同时处理「怎么用得起」和「怎么用得稳」两件事。
Tibo 再按重置键:额度福利如何变成 AI 编程圈的亚文化
I've reset usage limits for all ChatGPT Work and Codex users.
One day we created the reset button and the rest is history.
OpenAI Codex 与 ChatGPT 负责人 Tibo Sottiaux 宣布为所有 ChatGPT Work 与 Codex 用户重置使用额度,并复盘 GPT-5.6 Sol 消耗过快的原因:模型更爱长跑、多工具与子代理协同,同一 High 档位也比前代更烧 token;programmatic tool calling(code mode)带来并行与等待中的额外响应与缓存输入。他强调订阅计划本身没有缩水,典型场景续航预计约提升 18%,调查期暂停的五小时限额将恢复。社区反应已超出「领福利」:有人喊 Lord Tibo,有人开发雷达站盯推文预测重置,有人在重置前狂跑任务——重置按钮从运维控件变成了可预期的公共仪式。这暴露了 agent 时代的用量经济学:能力越强,长尾越贵,而「等 Tibo 按一下」成了闭源编程 agent 独有的情绪与生产力接口。

GitHub 增强 npm 与 Actions 安全性以阻断供应链攻击
在过去几个月内针对 npm 和 GitHub Actions 发布了多项更改,以阻断供应链攻击技术
阻断供应链攻击技术并限制其影响
GitHub 在过去几个月内针对 npm 和 GitHub Actions 发布了一系列安全更新,旨在阻断供应链攻击并降低其潜在影响。这些改进措施重点加强了包管理与自动化工作流之间的安全集成,为开发者提供了更具韧性的开发环境。通过针对性地防御恶意代码注入,该平台提升了开源项目的整体安全性,防止攻击者利用自动化工具进行大规模破坏。这些持续的更新体现了保障软件供应链完整性的迫切需求。开发者应积极采用这些新特性,以应对日益复杂的网络安全挑战。
来源: The GitHub Blog

基础模型
基础模型仍在用规模与架构换能力上限。开源侧 Kimi K3 把万亿级 MoE 与百万上下文推到可下载权重;闭源 agent 则用「能干活但更烧」的方式逼迫产品重新谈用量与效率。
Kimi K3 发布:2.8万亿参数混合专家模型,支持百万超长上下文
Kimi K3 是一款拥有 2.8T 参数、1040 亿激活参数、原生视觉能力和 100 万 token 上下文窗口的混合专家模型。
Stable LatentMoE 每次 token 有效激活 896 个路由专家中的 16 个... 使得整体扩展效率比 Kimi K2 提高了约 2.5 倍。
Kimi K3 是一款拥有 2.8 万亿参数的大型混合专家 (MoE) 模型,每次推理仅激活 1040 亿参数,并具备原生的视觉处理能力。该模型采用 Kimi Delta Attention 和 Attention Residuals 技术,支持高达 100 万 token 的超长上下文窗口,显著优化了长序列的信息流动。通过 Stable LatentMoE 架构从 896 个专家中激活 16 个,其训练效率比前代 K2 提升了约 2.5 倍。在后训练阶段,Kimi K3 通过强化学习增强了在编程、智能体任务及复杂推理方面的表现,能够处理长程执行任务。尽管其综合性能稍逊于 Claude Fable 5 和 GPT-5.6 Sol 等顶尖闭源模型,但在开源领域表现卓越。目前该模型权重已全面开放,旨在推动前沿智能技术的普及与协作。

研究论文
本栏目聚焦人工智能与前沿科技的深度探索。从 Claude Mythos 发现的加密算法漏洞,到 HiFi-UMI 利用高保真数据优化机器人操作策略,再到主流基准中的坏题审计,研究侧同时在抬高能力上限与拆掉虚高分数。
Claude Mythos 预览版发现加密算法的新漏洞
Mythos 仅用 60 小时的工作就改进了对其最著名的攻击方式,有效地将其密钥强度削减了一半。
Mythos 找到了一种破解此类简化版本的方法,并消除了攻击者需要进行的一次猜测,将之前最佳攻击的速度提高了 200-800 倍。
Claude Mythos 预览版成功发现了加密算法中的数学缺陷,其中包括针对后量子签名方案 HAWK 的重大攻击。该模型仅用 60 小时就将 HAWK 的密钥强度削减了一半,而该算法此前已通过了两年的专家人工评审。此外,Claude 还改进了对简化版高级加密标准 (AES) 的攻击,将现有攻击速度提升了 200 至 800 倍。虽然这些研究成果代表了 AI 驱动密码分析领域的重大进展,但目前并不会影响任何生产系统。这项研究强调了基础模型在发现数字安全基本构建模块缺陷方面的巨大潜力。结果表明,AI 将在评估和强化未来加密标准中发挥关键作用。
来源: Hacker News

HiFi-UMI:利用高保真数据实现无实机参与的机器人操作策略训练
它在没有外部跟踪基础设施的情况下达到了 3 毫米的工作空间局部末端执行器精度。
仅在 HiFi-UMI 演示上进行后期训练的策略可直接部署在真实机器人上,并与域内遥操作相匹配。
HiFi-UMI 系统在无需外部跟踪设施的情况下实现了 3 毫米的工作空间局部精度,证明了高质量的无机器人演示数据可以取代传统的实机微调。该方案集成了头戴式立体惯性 SLAM、微秒级同步触发器及覆盖 200 度的超广角相机,用于捕获高保真的操作数据。实验表明,仅在 HiFi-UMI 数据上进行后期训练的策略,其表现与实机遥操作相当,在 StarVLA-QwenPI 等模型上的成功率差异仅在 -2.5 到 +3.1 个百分点之间。研究团队开源了包含 2000 小时同步演示数据的 HiFi-UMI-2K 数据集,所有数据均经过仿真回放验证。在大规模预训练中,该数据集使未见任务的动作误差降低了 41%,并显著提升了实机部署的成功率,为机器人学习的大规模扩展提供了新路径。

研究揭示 GPQA 和 MMLU-Pro 基准中 12% 存在错误,已发布清理版
对 GPQA、MMLU-Pro 和 MMMU-Pro 基准测试的审计显示,多达 12% 的题目存在损坏并需被移除。
对 GPQA、MMLU-Pro 和 MMMU-Pro 等主流 AI 基准测试的审计发现,多达 12% 的评估题目存在逻辑错误或损坏,必须予以删除。这些基准测试是衡量大语言模型推理和知识能力的标准工具,题目质量直接影响评估结果。研究人员指出,这些损坏问题的存在可能导致之前的模型排名出现偏差。为了提高评估的严谨性,相关团队已发布了这些数据集的「清理版」。这一行动反映了 AI 研究界对评估数据质量的日益重视,旨在确保模型对比更加公平可靠。通过剔除歧义或错误题目,开发者能更准确地掌握模型性能的真实水平。
来源: r/LocalLLaMA
AI 应用
人工智能正加速渗透教育和医疗等垂直领域。吴恩达的 LearnVector 押注 1:1 个性化辅导,医疗机器人则靠 GPU 原生物理仿真补数据缺口——应用侧比拼的是能否落地,而不是榜单分数。
吴恩达创立 LearnVector:打造 1:1 专属 AI 个性化学习体验
来自 Coursera 的 1 亿美元投资
我们正在埋头研发,并将在 2027 年初展示产品。
吴恩达获得 Coursera 1 亿美元投资创立了 AI 公司 LearnVector,旨在将教育模式从「一对多」转变为「一对一」的个性化教学。针对现有聊天机器人因缺乏引导导致学生认知负担减轻、学习效果受损的问题,该平台致力于构建具备护栏的可靠学习指南。LearnVector 将根据个人学习进度规划路径并实时调整,确保用户在掌握新技能前获得持续陪伴。公司计划与 Coursera 和 Udemy 深度合作,利用权威素材库确保教学内容的准确性与相关性。该项目旨在通过 AI 消除优质辅导的经济与地理限制,首批产品预计于 2027 年初面世。
来源: Hacker News

利用 GPU 原生医疗物理仿真推动医疗机器人开发
医疗机器人不能依赖互联网规模的数据收集或无限的现实世界实验
每次演示都需要专业设备、临床专业知识以及接触患者或实验室环境。
医疗机器人开发因无法像自动驾驶或工业机器人那样依赖互联网规模的数据收集或无限的现实实验而面临严峻挑战。开发者面临的核心难题是数据缺口,因为每次演示都需要专业设备、临床专业知识以及接触患者或实验室环境。GPU 原生医疗物理仿真通过创建高保真虚拟环境来解决这些问题,为训练机器人策略提供支持。这种方法可以在没有现实试验风险的情况下,生成模拟复杂人体解剖结构和医疗程序的合成数据。通过弥合仿真与现实之间的差距,该技术能够实现医疗机器人系统的快速迭代和测试。它有效降低了在临床环境中开发先进机器人干预措施的门槛,同时确保了操作的安全性与精确度。
AI 政策与伦理
从业者开始用联署请愿的方式,要求政府管一管前沿模型的「配速」——当能力已经能挖密码漏洞、agent 能整夜烧额度,节奏本身成了公共议题。
1100名AI从业者签署请愿书,敦促美国政府监管尖端AI开发进度
1,100名尖端AI公司的现任/前任员工签署请愿书,呼吁美国政府介入
1,100多名尖端人工智能公司的现任和前任员工共同签署了一份请愿书,呼吁美国政府干预AI开发流程。该请愿书明确要求政府对尖端AI的发展「节奏」进行管理,以确保开发速度处于安全可控的范围内。这一举动反映了技术从业者对建立正式联邦监管机制的强烈需求,而非仅仅依赖行业自律。通过敦促政府介入,签署者表达了对当前开发速度可能超越现有安全框架的担忧。此次大规模联署代表了参与高级AI研究与部署的专业群体的重要声音,旨在将风险管理责任从私营公司转移至国家监管机构。
来源: r/LocalLLaMA
AI 基础设施
生产环境里的 agent 常「评测能过、上线翻车」。实时评估层与漂移监控,正在成为和额度管理同等重要的基础设施。
Prefactor:AI 智能体实时评估与性能监控平台
我们实时对每一次智能体运行进行评分,并在质量退化和漂移发生时将其呈现出来。
大多数智能体能通过评估但在生产环境中失败。Prefactor 是填补这一空白的评估层。
Prefactor 通过实时为每一次 AI 智能体运行打分,有效解决了智能体在评估阶段通过但在生产环境中失败的痛点。该平台专为向客户交付智能体的工程团队设计,能够实时监测规模化运行中的质量退化和性能漂移。作为专门的评估层,它让开发人员能够观察智能体在静态基准测试之外的真实表现。这种可观测性工具可帮助团队准确识别智能体在实时交互中出现故障的具体位置。系统旨在提供关于智能体性能的可操作见解,确保模型在部署后保持可靠性,并通过监控所有运行指标来减少意外行为。
来源: Product Hunt
本报告由 WindFlash AI 生成并经人工选题强化,内容基于过去 48 小时内的公开 AI 资讯。