Kimi K3 开源权重到货:2.8T 模型的规格、水分和落地选择
2026-07-28 · AI Models
7 月中旬,月之暗面发 Kimi K3 时写过一句硬话:完整权重在 2026 年 7 月 27 日 前放出。
这几天仓库已经挂在 moonshotai/Kimi-K3 上,许可证是 Kimi K3 License。时间表对上了。AI 圈里“计划开源”的新闻很多,按期交货的少。K3 至少把后半句补上了。
刷屏之后,工程侧更关心几件具体事:模型卡上哪些数字决定账单,官方基准怎么读才不会被 harness 骗,许可证允不允许你那套商用形态,以及现在该不该动自部署。

到货清单
按 Hugging Face 模型卡 和官方说明,K3 的公开定位是:
- 开放权重、原生多模态、偏 agentic
- 总参数 2.8T,激活约 104B
- 官方称为 open 3T-class
- 上下文最长约 100 万 token
- 侧重长程编码、知识工作、工具编排
- 权重使用 Kimi K3 License
它不是只放几个研究 checkpoint。月之暗面把接近闭源对比表上的模型,放到可下载、可部署、可改的路径里。
Tom's Hardware 写得更糙:有足够 GPU 机架的人,离“自己卖推理”又近了一步。
还有一句必须放在前面:能下载,和笔记本能跑是两回事。
读规格时别被 2.8T 带走
| 维度 | 官方模型卡 | | --- | --- | | 架构 | MoE | | 总参数 | 2.8T | | 激活参数 | 104B | | 层数 | 93 | | Expert 数 | 896 | | 每 token 选中 | 16 | | Shared Experts | 2 | | 注意力 | KDA + Gated MLA(69 + 24) | | 上下文 | 1,048,576 tokens | | 视觉编码器 | MoonViT-V2(约 401M) | | 量化 | MXFP4 权重 / MXFP8 激活 | | 模态 | Text, Image |
MoE 里,总参数更像仓库容量。单次推理烧的是激活参数、上下文、KV cache、并行策略和量化。K3 每个 token 大约点亮 104B,从 896 个 expert 里选 16 个。官方称相对 K2,扩展效率大约高 2.5 倍。
它比“真·2.8T dense”好部署。104B 激活叠长上下文和多模态,仍然是机架级问题。
做容量表时,我优先填这些格:激活参数和量化精度;业务真实会开到的上下文长度;agent 多轮和工具调用带来的并发;MoE 通信开销。海报上的 2.8T 先靠边。
为什么讨论声这么大
日期写死,仓库按期出现。7 月 16 日前后先有 API 和产品,7 月 27 日前权重到位。这种节奏比任何榜单截图都像在做事。
开放权重的讨论也上了一个台阶。以前多数争论停在“中小模型够不够用”或“百 B 级能不能逼近前沿”。K3 把话题抬到:开放权重能不能和闭源坐同一张对比表。
产品卖点也不在聊天更顺,而在长时间干活:长程工程会话、大仓库导航、终端工具编排,以及 kernel、编译器、CAD 一类硬任务。2026 年很多团队抢的是连续几小时的完成率。
采购侧会跟着变敏感。Terminal-Bench、BrowseComp、MCP 相关分数如果继续贴近闭源,买家会问:多付的闭源溢价,买的是能力、稳定性、合规,还是习惯?这不会让所有人立刻自建集群,但会把开放权重重新写进评审表。
基准:先读注释,再读分数
模型卡给出了与 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2 等的对比。官方口径下几项比较扎眼:
- GPQA Diamond:93.5
- Terminal-Bench 2.1:88.3
- BrowseComp:91.2
- SWE-Marathon:42.0
- MCPMark-Verified:94.5
同一模型换 Kimi Code、Claude Code 或 Codex,分数能差一截。K3 多在 max reasoning effort、temperature=1.0;对比模型有 fallback、refusal、xhigh 等不同设置。第三方复核也还没走完。厂商表有用,权重开放的一个好处,是社区能复现、挑刺、蒸馏。
我能接受的产品结论比较窄:在 coding、agent、工具调用几块,开放权重已经能进闭源的短名单。还没到“全面替换”那一步。
不同角色会看到不同账单
独立开发者和小团队,先别把兴奋点放在“本地下载 2.8T”。更近的变化是托管商会抢着上 K3,API 议价空间变大;长任务和工具调用密集的路径,可能出现更便宜的开放权重路由;私有数据上的适配实验空间变大,但仍要先看许可证。
稳妥路径很土:在托管 API 上跑自己的任务回归;agent 外壳保持不变,和 Claude / GPT / Gemini 同条件比;只有数据驻留、单位成本或可控性顶到硬约束时,再评估自部署。
产品和平台团队会更快走向多模型路由。harness 的权重会上升:上下文怎么管、工具谁能调、何时停、日志怎么记。评测也该从榜单切回自己的仓库、工单、知识库和历史失败样本。
模型更会规划之后,危险经常不在答错,而在“格式过了就执行副作用”。我们写过这个问题:校验通过了,不等于可以执行。
基础设施和采购可以把这些格补进评估表:许可证是否覆盖你的商用和再分发;推理栈是否成熟;MoE 通信和故障恢复成本;红队、内容策略、工具越权;tracing、成本归因、缓存能否接入现有系统。缺这些格子,买到的往往是能打的模型,不是能运营的服务。
常见误读
权重可下,并不自动附带训练数据、训练代码和对齐流程。许可证是 Kimi K3 License。别按 Apache/MIT 的默认想象去签采购。上线前读 LICENSE。
本地推理也有账单:存储、带宽、GPU、运维、评测、安全。开放权重改的是成本结构和可控性。
企业流程常死在工具稳定性、长上下文一致性、权限审计、尾延迟和失败恢复。一张总分表解决不了这些。
规划能力和工具使用能力上去后,未授权副作用也会放大。更多团队会把强模型接进内网。如果 agent 仍把“参数校验通过”当成“允许执行”,风险会跟着能力一起涨。
一周能做完的最小闭环
不必等生态完美。一周可以写完一份决策备忘录:
- 固定约 20 个真实任务:修代码、问仓库、做研究、处理表格文档、调内部工具。
- 用现有 agent 外壳测 K3 托管 API,别用官方 demo 外壳自嗨。
- 记失败:死循环、越权、上下文丢失、长任务中途跑偏。
- 算成功任务成本,别只盯 token 单价。
- 读许可证:商用、对外服务、衍生模型规则。
- 小范围路由:低风险走便宜路径,高风险走高约束模型或人工审批。
- 写结论:本季度自不自部署、K3 做不做第二路由、哪些流程禁止自动执行。
这比在群里发“我们关注 K3 开源”有用。
往后几个月
最近几周,托管平台会抢 Day-0 支持,社区会吵量化、复现和能不能跑起来,闭源厂商会强调稳定、安全和生态绑定。
再往后一两个季度,多模型加强 harness 会更像默认解法。开放权重扛执行量,闭源扛高风险决策,这种混合会更常见。Agent 产品的差异,也会从模型 logo 挪到完成率和治理能力。
如果开放权重继续按承诺交付,并在 agentic 场景站得住,稀缺性会从“有没有模型”挪到“能不能安全、稳定、便宜地跑模型”。那时值钱的是评测、权限和基础设施。
FAQ
Kimi K3 是什么?权重开放了吗?
Kimi K3 是月之暗面的 2.8T 级开放权重多模态 Agent 模型。官方承诺 2026 年 7 月 27 日前放出完整权重,目前已在 Hugging Face moonshotai/Kimi-K3 可下载,许可证为 Kimi K3 License。
它有多大?本地能跑吗?
总参数约 2.8T,激活约 104B,896 选 16 的 expert 路由,上下文最长约 100 万 token。实际成本看量化、上下文、并发和 MoE 通信。消费级单卡通常不够;云托管或机架/集群推理更现实。
能替代 Claude 或 GPT 吗?
在部分 coding、浏览和工具基准上,官方数据已经贴近若干闭源模型。能否替换取决于 harness、延迟、合规、安全策略和失败代价。多模型路由通常比一刀切替换更稳。
权重开放后要立刻自部署吗?
多数团队不用。先用托管 API 做真实工作流回归;只有数据驻留、单位成本或可控性成了硬约束,再谈自托管。权重开放先增加选项。
Kimi K3 License 等于 Apache 或 MIT 吗?
不等于。以官方 LICENSE 为准。上线前确认商用、再分发、对外服务和衍生模型条款。
结尾
K3 这两天热,因为三件事叠在一起:开放权重摸到了 3T 级叙事;“会开源”变成了可核对的交货;agentic 工作负载成了主战场。
多数团队下一步不该写口号。把 K3 丢进评测集、成本模型和权限边界里,给自己一周,写出结论。
模型还会继续变强。差距往往在:你能不能把强模型放进可观测、可授权、可回滚的系统里。
延伸阅读
主要来源