post cover

AI 热点快报:西方实验室用三分之一算力反攻开源——Mistral Large 4 以 1T 参数、计划开放权重对标中国开源模型(2026-10-07)


事件与背景

  • 2026 年 10 月 6 日,法国 AI 实验室 Mistral AI 发布 Mistral Large 4(ML4),一个约 1 万亿参数的大型多模态模型,代号 “Le Chonk”。以题图标题即点明其野心:「Mistral 的新 1T 模型意在跃过闭源与开源对手」。该消息于当日在 Hacker News 首页冲到 1150 分、106 条评论。报道来源:TechCrunch 报道。
  • 算力叙事是这次发布的核心:据 TechCrunch 引用 Mistral 科学副总裁 Pierre Stock,ML4 完全在 Mistral 自有算力上训练,仅用 4000 张 Nvidia GPU——「比我们的中国竞争对手少两到三倍,也明显少于闭源竞争对手」。
  • 权重将以「分级开放」的方式释放。Stock 对 TechCrunch 表示:「在此期间,我们会与可信伙伴和政府合作,确保开源的权重可以被用于防御,而不会被用于恶意攻击。」也就是说,开源权重是有条件、有伙伴筛选的,而非一把梭全放。
  • 同一周(10 月 5 日),美国 Brooklyn 的 Reflection AI 也放出其首个前沿开源权重模型 Beam:5010 亿总参数、230 亿激活参数的 MoE,预训练 23.8 万亿 token,100 万 token 上下文窗口;官方称在高级推理基准上对标智谱 Z.ai 的 GLM-5.2,且只用「1/3 到 1/4 的推理算力」,权重与完整技术细节本月发布。来源:TechCrunch、Reflection 官方博客。
  • 独立评测方已给出数字,但标注仍是预览:Artificial Analysis 的 Mistral Large 4 页面给出 Intelligence Index 38 分(同类中位数 26),标价 $1.36/百万输入 token、$4.18/百万输出 token,缓存折扣 90%,输出速度约 116 token/秒,上下文 524k;但该页仍将模型标为 “Preview”(预览)且属于 Proprietary(专有)。API 聚合平台 OpenRouter 页面显示其为多模态(文本 + 图像输入),定价 $0.68/$2.09,最大输出 262,144 token。
  • ⚠️ 官方公告页未通过本次 curl 验证:Mistral 官方发布页 https://mistral.ai/news/mistral-large-4/ 被 Cloudflare 人机校验拦截,本机 curl 只能取到 “Just a moment…” 挑战页,故本文仅将其列为参考,正文事实均来自上述可访问来源。

为什么现在重要

  1. 「开源权重」已从副产品升级为前沿竞争的主战场。 过去开放权重常被理解为模型厂商清库存、或做社区生态的次级策略;这一周里,Mistral 把它当成对标闭源的旗舰形态,Reflection 甚至把整个公司定位在开源权重前沿模型上。影响:当开源权重成为主动战略,你在选型时的默认假设要改——「闭源最强、开源只能追」的旧结论不再自动成立。

  2. 「用多少算力训出来」成了新的宣言式卖点。 Mistral 强调 4000 张 GPU、比中国同行少 2–3 倍;Reflection 强调推理算力低 3–4 倍。影响:竞争的焦点从「谁参数最大」转向单位算力能换来多少智能——这会直接压低推理成本曲线,也让「算力受限的团队也能做前沿模型」成为可辩护的商业叙事。

  3. 「防御性开放」把安全与合规写进了权重的发布方式。 「用于防御、不用于恶意攻击」「与可信伙伴和政府合作」,意味着开源权重正被包进一层分级分发的合规外壳。影响:想自托管前沿开源权重的团队,未来要面对的不只是许可证,还有合作伙伴白名单、用途声明、地域限制这类准入门槛。

  4. 厂商自报与独立评测之间的落差,一眼可见。 Mistral 的「基准还在出」,Reflection 的「性能未被独立验证」,而 Artificial Analysis 已经把 ML4 标为 Preview 并给出 38 分。影响:别把发布会的对标当结论——在权重真正放出、第三方复现之前,选型应基于你自己的测试集,而不是厂商标称的 SOTA 位置。

  5. 这轮「西方开源」带着强烈的主权与产业色彩。 ML4 的优化场景是网络安全、金融,以及芯片设计——后者正对应其两大投资方:领投 C 轮的荷兰 ASML 与上月领投 D 轮的三星(估值 210 亿欧元)。影响:开源前沿模型正在被绑定到国家/产业主权叙事上,采购与合规团队会比纯技术团队更早感受到这层变化。

工程师/产品人今天能做什么(1 周内可执行)

  1. 今天就用自己的评测集打一次 ML4。 通过 OpenRouter 或 Mistral API,拿你现有的 10–30 个人工标注任务跑一遍,和 GLM、DeepSeek、Qwen 以及你正在用的闭源模型做同表对比,重点看 agentic coding、长上下文、图像输入三类。半天可完成。

  2. 短期按 API 接入,别提前押注「权重马上可用」。 因为 ML4 目前仍是 Preview/Proprietary、开放权重尚在「伙伴框架」中,架构上先把它当普通托管 API 接,把自托管当成后续选项,避免把首发计划绑在一个还未落地的权重包上。

  3. 给模型候选池加一层可替换抽象。 复刻选型逻辑成薄接口(complete(prompt, model_cfg)),让 ML4、Beam、GLM 只是配置项。这一周之内,你就能在模型快速迭代时把切换成本压到一处。

  4. 算一次真实的成本账。 用 AA 的 $1.13/任务 与缓存 90% 折扣、以及 OpenRouter 的低价档位,估算你月均 token 下 ML4 相对现用模型的差价;别只看每百万 token 单价,要算「每完成一个任务」的代价。

  5. 盯住权重发布条款。 如果自托管是你的合规要求,本周就去确认:许可证、分发渠道(超大规模云/neocloud)、以及是否要求「用途声明/伙伴准入」。把它纳入你的数据驻留与供应链审查清单。

待观察

  • 权重到底何时、以什么许可证发布。 Artificial Analysis 仍标 Preview/Proprietary,TechCrunch 与 Mistral 口径是「计划开放」,但具体时点、是否分阶段、是否设准入门槛尚未确认。这是判断「真开源」还是「有条件的部分开放」的关键节点。
  • 独立基准能否证实「对标中国开源」。 HN 评论区有读者引用报道称 ML4 在 DeepSWE 上「与 GLM 5.3 相当」,同时该贴也充斥着「是否蒸馏了中国开源模型」的争论——这些均为社区说法,未经独立验证,待第三方复现与更完整基准出来。
  • Reflection Beam 的权重落地情况。 官方称「本月发布权重与技术细节」,届时能否按时、以及能否经受独立评测,将决定这轮「西方开源反攻」是口号还是既成事实。