2026年7月23日星期四 · 共 10 篇精选

编辑视角
今天最值得关注的消息不是某个产品发布或融资数字。陶哲轩公开了一段与 ChatGPT 的技术对话:模型独立验证了两个多项式映射互为逆同构,这是探索雅可比猜想潜在反例过程中的一步。对话涉及模定义方程的多项式约化,以及从 C^3 到 C^3 的常雅可比复合映射的符号确认。这不是聊天机器人解作业题,而是一位菲尔兹奖得主把大模型当作符号计算伙伴,用在代数几何的开放问题上。
同一期报告中有两篇世界建模论文,意义在另一个维度。AlayaWorld 是一个开源的 150 亿参数视频扩散 Transformer,能从文本、图像或视频输入生成交互式 24fps 视频,分辨率覆盖 540p 和 720p。ABot-World-0 更进一步:在单块 RTX 5090 上以 16 FPS 流式输出 720P 画面,动作到首帧延迟 1.2 秒,峰值显存约 19 GiB。半年前,交互式世界生成还是需要集群支撑的研究课题,现在一块桌面显卡就能跑起来。对合成训练环境、游戏原型和空间计算而言,这个门槛的变化是实质性的。
商业侧的数字已经不再令人惊讶,只是因为它来得太频繁。Anthropic 五月年化营收达到 470 亿美元,2025 年这个数字是 90 亿。主导了其 5 亿美元 D 轮的 Menlo Ventures 合伙人 Matt Murphy 说,这是他二十五年风投生涯中见过的最快规模化,比互联网浪潮、移动时代和第一轮云计算都快。OpenAI 这边发布了 Presence,一个面向企业的 Agent 平台,把策略、护栏和升级规则直接内建到账单处理、保险理赔这类生产流程里。两家公司传递的信号一致:实验阶段结束了,治理层本身就是产品。
Google 的 Gemini 3.6 Flash 家族带来了 Lite 和 Cyber 两个专用变体,模型专业化已经是默认选项。NVIDIA 的 TensorRT 更新则为 Python 和 C++ 引擎构建加入了可观测和可取消能力。基础设施在成熟,开发者面对的问题不再是模型能不能用,而是周边的工具链、监控和访问控制能不能跟上。
研究论文
本周研究前沿涵盖了从数学猜想探索到交互式世界模型的关键突破。陶哲轩利用大模型辅助数学推导,展示了AI在基础科学中的潜力;而AlayaWorld等项目则推动了高效视频生成技术的发展。此外,关于强盗凸优化下界与自监督学习统一框架的研究,深化了对算法复杂度和特征提取机制的底层理解。
陶哲轩使用 ChatGPT 探索雅可比猜想的反例
我独立检查了这些恒等式,这两个映射是互逆的多项式同构。
能否通过符号确认,从 (a,y,z) 到 C^3 得到了一个具有常数雅可比矩阵的多项式?
陶哲轩与 ChatGPT 进行了一场关于雅可比猜想潜在反例的技术对话,旨在验证相关的代数构造。AI 在对话中独立确认了特定簇 X 与仿射空间 A^3 之间的两个映射互为逆多项式同构。通过符号化验证,ChatGPT 确认了从 C^3 到 C^3 的多项式映射 G 在组合变换后仍保持常数雅可比矩阵。该过程涉及处理模定义方程的多项式化简,展示了 AI 在辅助高阶数学研究中的潜力。对话特别讨论了如何消除初步公式中的奇点,以确保映射在全域内具有多项式性质。这一案例突显了顶尖数学家开始利用大语言模型进行严谨的符号运算和公式验证的趋势。
来源: Hacker News

AlayaWorld:支持长程生成的150亿参数开源交互式视频世界模型
AlayaWorld 是一款交互式长程视频世界模型,可生成 540p 和 720p 分辨率的 24-fps 视频。
AlayaWorld 基于 15B 视频扩散 Transformer 构建,以自动回归方式生成短潜变量块。
AlayaWorld 推出了一款拥有 150 亿参数的视频扩散 Transformer,能够以 24-fps 帧率生成 540p 和 720p 分辨率的交互式视频。该模型改变了传统游戏开发依赖密集人工资产生产的模式,支持通过文本、图像或视频输入即时生成可探索的虚拟环境。其核心架构采用自动回归生成短潜变量块的方式,并结合持久汇聚帧、压缩时间历史和几何对齐的空间记忆来维持时空一致性。为了减少长期漂移,该模型使用其自身回滚数据中的损坏历史进行训练,并通过离散自动回归蒸馏技术将推理步数从约 30 步优化至 4 步。作为一项开源项目,AlayaWorld 在 iWorld-Bench 上取得了长程生成的最佳性能。

ABot-World-0:单块桌面 GPU 实现无限交互式世界生成
ABot-World-0 在单块 NVIDIA RTX 5090 桌面 GPU 上以高达 16 FPS 的速度串流 720P 视频
1.2 秒的动作到首帧延迟和约 19GiB 的峰值显存
ABot-World-0 在单块 NVIDIA RTX 5090 GPU 上实现了 720P 视频以 16 FPS 的速率实时串流,且峰值显存占用仅约 19GiB。该动作条件视频世界模型通过整合 AAA 游戏和模拟引擎的多源数据,学习可控的世界动态并支持长时程闭环交互。研究团队通过 ODE 蒸馏和 LongForcing 技术缓解了自回归漂移,确保了生成内容的一致性。系统采用原生键盘操作作为控制接口,支持场景漫游与角色交互,并通过参考角色记忆维持身份稳定性。其优化的推理栈将动作响应延迟缩短至 1.2 秒,标志着在消费级硬件上运行高保真交互式世界模型取得重大进展。

强盗凸优化新下界:证明其比线性强盗更具挑战性
在随机强盗凸优化的极小极大预期遗憾上建立了近似最优的 Omega-tilde 下界,量级为 d 的 5/4 次方乘以 sqrt(T)
确立了随机强盗凸优化在本质上比线性强盗更难。
在欧几里得球体上进行的 1-Lipschitz 函数随机强盗凸优化(BCO)被证明具有量级为 d 的 5/4 次方乘以 sqrt(T)(对数因子内)的极小极大预期遗憾下界。这一发现建立了首个增长速度快于标准 d 乘 sqrt(T) 的非平凡遗憾下界,从理论上证明了随机 BCO 在本质上比线性强盗问题更难。研究人员通过构造一类包含"管道"结构和平方距离函数的硬凸函数,揭示了学习者在寻找未知线性变换与最小化目标函数之间的权衡。该分析进一步得出了寻找 epsilon-最优动作所需的样本复杂度下界,量级为 d 的 5/2 次方除以 epsilon 的平方(对数因子内)。研究结果不仅适用于受限环境,也扩展到了无约束设置,为理解强盗反馈下凸优化的性能极限提供了关键理论依据。
来源: arXiv stat.ML
通过潜变量分布匹配统一自监督学习框架
我们将SSL视为潜变量分布匹配(LDM):在假设的潜模型下学习最大化其对数概率的表示
预测性LDM在轻微假设下产生可辨识的潜变量表示,即使使用非线性预测器也是如此
自监督学习(SSL)通过将学习过程建模为潜变量分布匹配(LDM),实现了从复杂数据中提取通用表示的理论统一。该框架通过最大化对数概率和潜变量熵,有效整合了对比学习、非对比学习及预测性SSL等多种现有方法。研究团队基于LDM推导处一种适用于高维时间序列的非线性贝叶斯滤波模型,并配备了卡尔曼预测器。数学证明显示,即便在非线性预测条件下,该方法也能确保潜变量表示的可辨识性。这一成果为开发新型SSL算法提供了原则性指导,并揭示了现有主流模型背后的核心假设。
来源: arXiv stat.ML
AI 智能体
AI 智能体正从简单的对话工具转向具备自主执行与社交协作能力的复杂系统。OpenAI 推出的 Presence 平台标志着企业级部署与管理的成熟,而 Humalike 的社交插件则赋予了智能体更深层次的人际互动能力。这些进展不仅推动了 AI 在工作流中的深度集成,也预示着数字员工正朝着更专业、更具社交智慧的方向快速演进。
OpenAI 发布 Presence:企业级 AI 智能体部署与管理平台
Presence 将模型推理与政策、护栏和升级规则相结合,以验证准确性和性能。
Codex 提出更新建议,团队可以对其进行测试和批准,帮助智能体随客户行为的变化而调整。
OpenAI 正式推出企业级产品 OpenAI Presence,旨在帮助企业在生产环境中部署并管理高价值的 AI 智能体。该系统将模型推理能力与特定政策、护栏及升级规则相结合,确保在处理账单结算、保险理赔或 IT 服务请求等任务时具备高准确性。Presence 为智能体仅提供特定任务所需的知识和系统访问权限,并允许公司设定智能体的操作边界与人工介入机制。系统上线后,可利用 Codex 驱动的改进流程,根据实际运行数据和异常情况自动提出更新建议。目前该产品已支持语音和聊天形式的实时交互,涵盖客户支持、外呼销售及高风险内部工作流等多种应用场景。
来源: Hacker News
Humalike x Hermes:为 AI 智能体注入社交智慧的插件
针对 Hermes Agent 的社交智能插件
它能决定何时发言、适应群组语调并记住谁说了什么。
Humalike 推出了针对 Hermes Agent 的社交智能插件,旨在提升 AI 智能体在群体对话中的行为表现。该插件使 AI 能够自主判断发言时机,并根据群聊氛围自动调整语气,同时能够准确记录并区分不同发言者的身份。作为一种行为基础设施,Humalike 提供了 API 和模型,赋予智能体原本缺失的社交技巧与对话主动性。目前该工具已支持 Slack、Telegram 和 WhatsApp 等主流社交平台,显著增强了 AI 在群组互动中的真实感。这是该团队推出的第二个重要产品,致力于解决当前模型在社交情境下表现僵硬的问题,让 AI 沟通更加人性化。
来源: Product Hunt

AI 商业
深入探讨人工智能行业的商业化进程,涵盖从风险投资洞察到初创企业增长策略的方方面面。我们关注 Anthropic 等领军企业的扩张经验,并为 AI 创业者提供实用的融资与经营建议。通过分析不断演变的商业模式和市场趋势,帮助您把握 AI 从技术研发走向全球企业级应用过程中的关键经济机遇。
Menlo Ventures 合伙人谈 Anthropic 的增长及 AI 创业建议
Anthropic 到 5 月份时收入运行率已跃升至 470 亿美元,而 2025 年仅为 90 亿美元。
Menlo 领投了 Anthropic 5 亿美元的 D 轮融资,Murphy 拥有前排席位
Anthropic 到 5 月份时收入运行率已跃升至 470 亿美元,而 2025 年仅为 90 亿美元。Menlo Ventures 合伙人 Matt Murphy 表示,这种增长速度在他 25 年的投资生涯中从未见过,甚至超过了互联网和移动通信浪潮。Menlo 领投了 Anthropic 5 亿美元的 D 轮融资,这让 Murphy 能够近距离观察该公司从无营收阶段快速跨越的历程。他针对当前 AI 初创企业创始人提出了不同以往的建议,强调了生成式 AI 时代的独特竞争环境。此次对话深入探讨了 AI 领域前所未有的扩张速度以及创始人必须做出的战略调整。
来源: TechCrunch AI

基础模型
基础模型是现代人工智能的核心架构层,为各种下游应用提供了通用的智能基础。当前行业正致力于平衡计算效率与模型性能,正如谷歌最新发布的 Gemini 3.6 Flash 系列所展示的那样,轻量化与专用化已成为关键趋势。这些进展不仅提升了推理速度,也为部署高效、可扩展的 AI 解决方案开辟了新路径。
谷歌发布 Gemini 3.6 Flash 系列模型,涵盖 Lite 与 Cyber 版本
Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber
谷歌推出了 Gemini 3.6 Flash 系列模型,具体包括 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 版本。此次发布展示了模型架构向专业化分层的转变,为开发者提供了满足不同延迟需求和特定安全任务的选项。3.6 Flash 作为核心更新提升了运行速度,而 Flash-Lite 版本则专注于资源受限的应用场景。此外,Flash Cyber 模型的出现标志着 Gemini 生态系统开始针对网络安全领域进行专项优化。这些新模型旨在解决硬件和软件限制下的 AI 集成挑战。这一举措进一步强化了小型高效语言模型在企业快速部署中的竞争地位。
来源: Product Hunt
开发工具
本栏目聚焦于助力开发者构建与优化软件系统的核心工具。我们关注 NVIDIA TensorRT 等编译器及高级调试环境的最新进展,涵盖跨平台开发与性能监测。这些工具通过增强可观察性与控制力,简化了开发流程,帮助工程师在多元硬件架构上实现高效、稳定的应用程序。
使 NVIDIA TensorRT 引擎构建在 Python 和 C++ 中可观察且可取消
TensorRT 引擎的构建可能需要几秒到几分钟的时间。
大多数 NVIDIA TensorRT 集成在构建期间不报告任何信息,也不提供提前中止的方法。
NVIDIA TensorRT 引擎的构建时间受模型复杂度及 GPU 硬件规格影响,可能从几秒钟延伸至数分钟。目前大多数 TensorRT 集成在构建过程中缺乏进度报告机制,且无法提前中止任务。开发者常因深度策略搜索或冷计时缓存而在终端面临类似“假死”的状态,难以判断是否需要重试。通过引入可观察性和可取消性,开发人员和 AI 代理能够实时监控构建状态并及时释放资源。这一改进显著提升了 Python 和 C++ 环境下 AI 模型部署的效率与交互体验。

本报告由 WindFlash AI 自动生成,内容基于过去 48 小时内的公开 AI 资讯。