Kimi K3 开源权重发布:2.8万亿参数模型登顶开源前沿(2026-07-28)
本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:moonshotai/Kimi-K3 原文链接:https://simonwillison.net/2026/Jul/27/kimi-k3/ 原文发布:2026-07-27 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。
译者按
7 月 16 日 Moonshot AI 发布 Kimi K3 时,曾承诺在 7 月 27 日之前开源权重。他们如期兑现了。这不仅是国内大模型”论文发布—权重开源”承诺的一次重要履约,也是全球开源模型社区的标志性时刻:2.8 万亿参数(104B 激活)、原生视觉、百万 token 上下文的模型,以完整权重形式向公众开放。
但更值得中文读者关注的是 K3 许可证的演变轨迹——从 K2 的”修改版 MIT”到 K3 要求大型 MaaS 企业签署单独协议,Moonshot 在”开放”与”商业保护”之间的平衡策略越来越清晰。这与 DeepSeek 的完全 MIT 许可、GLM 的多层次许可策略形成鲜明对比,折射出中国 AI 企业在开源路线上的多元化探索。本文将围绕 Simon Willison 的短评,结合 arXiv 技术报告,深度解读此次开源发布的意义。
正文
2026 年 7 月 27 日,Moonshot AI 信守了本月早些时候的承诺,在 Hugging Face 上发布了他们 2.8 万亿参数模型的权重。
这些权重的体积相当惊人——整整 1.56TB。
回顾许可证的演变:早在 2025 年 7 月发布 Kimi K2 时,Moonshot 就引入了一个自制的 MIT 许可证修改版。该版本仅在原始 MIT 许可证基础上增加了一段要求:
仅有的修改条款是:如果本软件(或其衍生作品)被用于任何月活跃用户超过 1 亿,或月收入超过 2000 万美元(或等值其他货币)的商业产品或服务,你必须在该产品或服务的用户界面上显著展示”Kimi K2”字样。
而到了 K3,许可证不再自称”修改版 MIT”,限制条件更进一步——对于大型”模型即服务(MaaS)“企业,需要与 Moonshot 签署单独协议:
如果被许可方或其关联方经营 MaaS 业务,且被许可方及其关联方在任何连续 12 个月内的总收入超过 2000 万美元(或等值其他货币),则被许可方必须在将本软件或其衍生作品用于任何商业目的之前,与 Moonshot AI 签订单独协议。
值得一提的是,Moonshot 的诚实之处在于:他们在自己的宣传材料中从未试图将这种许可证描述为”开源”,而一贯使用”开放权重(open weight)“这个更准确的术语。
目前 OpenRouter 已经上线了来自 7 个供应商的 K3 推理服务,大部分定价与 Moonshot AI 官方一致:每百万输入 token 3 美元,每百万输出 token 15 美元。
与此同时,Moonshot AI 同日也在 arXiv 发布了 Kimi K3 的技术报告(arXiv:2607.24653),题为《Kimi K3: Open Frontier Intelligence》。报告揭示了一些重要的技术细节:
- 架构:2.8T 参数的 MoE 模型,采用 Kimi Delta Attention(KDA)和 Attention Residuals 改进信息在序列长度和模型深度的流动
- 激活参数:896 个路由专家中每 token 激活 16 个,共计 104B 激活参数
- 上下文窗口:原生支持 100 万 token
- 视觉能力:原生视觉能力,不依赖外部视觉模型
- 缩放效率:相比 Kimi K2 整体缩放效率提升约 2.5 倍
- 后训练:覆盖通用、Agent 和编码领域的强化学习,支持多种推理努力水平,实现组合泛化和稳健的长周期执行
评测方面,K3 在长周期编码、Agent、知识、推理和视觉任务上均达到前沿水平。虽然综合性能仍落后于最强的闭源模型——Claude Fable 5 和 GPT-5.6 Sol——但在开放权重模型中稳居榜首,并超越了许多闭源竞品。
值得注意的是,Kimi K3 目前在 Arena.ai 的前端编码竞技场上位列第一,超过了 Claude Fable 5。定价方面,每百万输入/输出 token 分别为 3/15 美元——这是中国 AI 实验室迄今为止发布的最昂贵模型。
译者注
1. 关于”修改版 MIT”许可证 Kimi K2 采用的许可证被业界戏称为”K2 License”。它在 MIT 基础上加了”超过月活 1 亿或月收入 2000 万美元需显式展示品牌”的条款。这在开源社区引发了大量讨论——它是否符合 OSI 定义的开源?答案是否定的。这也是为什么 Moonshot 在 K3 上更进一步,直接要求大型 MaaS 企业签署独立协议。
2. 与 DeepSeek 和 GLM 的许可策略对比
- DeepSeek:采用完全 MIT 许可证,没有任何附加条款。DeepSeek V4 Pro 完全 MIT 开源,权重可在 Hugging Face 自由下载商用。
- GLM-5.2(Z.ai):采用多层次许可——对非商业用途基本开放,商业用途需按规模分级授权。
- Moonshot K3:开放权重 + 针对大型 MaaS 企业的单独协议要求。本质上是通过许可证条款保护自身 API 业务不受大厂”白嫖”。
这种分化表明,中国 AI 企业正在寻找”开放”与”可持续”的平衡点。没有一家能承受完全 MIT 带来的商业风险(尤其是考虑到训练一个 2.8T 参数模型的天文成本),但也没有一家愿意放弃开源带来的生态效应和开发者信任。
3. 开源 vs 开放权重 Moonshot 一直诚实地使用”开放权重(open weight)“而非”开源(open source)“来描述 K3 的发布。这个区分很重要:OSI 定义的开源要求自由的再分发权、获取源码权、修改权和不受歧视的商用权。K3 的许可证对大型 MaaS 企业做了明确限制,因此不符合 OSI 定义。但这并不意味着它没有价值——开放权重 + 技术报告的组合,已经让小团队和研究者获得了前所未有的研究能力。
4. Kimi K3 的规模意义 2.8T 参数是全球最大的开放权重模型之一,仅次于 DeepSeek 的某些 MoE 变体。更关键的是,104B 激活参数意味着推理成本可控——每 token 只激活约 3.7% 的参数,实际计算量接近 100B 级别的密集模型。这也是 Moonshot 能以相对有竞争力的价格($3/$15)提供 API 服务的原因。
延伸阅读
- Kimi K3 与 pelican 基准测试的启示(2026-07-17)
- 开源模型与闭源模型的安全不对称性:从 OpenAI 攻击事件看(2026-07-23)
- 美国初创公司呼吁政府不要切断中国开放权重 AI 的访问(2026-07-24)
- GLM-5.2:可能是最强的纯文本开源 LLM(2026-06-18)
- OpenAI GPT-5.6 家族:Luna、Terra、Sol(2026-07-10)