AI 热点快报:Google 把最强模型锁进保险柜——Gemini 4 Argon 只发给「可信网络防御者」,前沿模型进入分级发布(2026-10-02)
事件与背景
2026 年 9 月 30 日,Google 发布 Gemini 4 Argon——七个多月来首个非 Flash 级前沿模型(其间连已经官宣的 Gemini 3.5 都被整个跳过)。但发布方式比模型本身更值得注意:Google 没有开放它,而是先把它交给一组「可信网络防御者」(trusted cyber defenders)。Google DeepMind 负责人 Koray Kavukcuoglu 表示,公司「正积极参与美国政府自愿的预发布模型访问流程」,并将逐步扩大范围。
时机本身也带信号:这是 Kavukcuoglu 于 8 月接任 DeepMind 负责人后的第一次前沿发布,且紧接在 OpenAI DevDay 的次日(OpenAI 刚发了 Dots agent 与 GPT-6.1 Sol)。The Verge 还提到,AI 社区本周早些时候已在 X 上因「疑似泄露的 Argon 基准」而热议——发布前就先跑了一轮舆论。
- 首发放给防御方,且不启用网络护栏。 Argon 以 Fairwind 计划的名义先给可信安全团队和 Google 内部使用,这批用户拿到的版本不启用网络类护栏。Google 用「能力到了这个级别需要分阶段」来解释,先用早期测试者反馈迭代护栏,之后才对付费 API 客户与 Google AI Ultra 订阅者开放——没有给日期,只说「as soon as possible」。
- 独立评测:追平但未领先。 Artificial Analysis 的 Intelligence Index(High 档)给 Argon 53 分,与 OpenAI GPT-6 Astra(max)并列,领先 GPT-6.1 Sol(max)1 分,比自家 Gemini 3.1 Pro Preview 高 23 分;但仍落后 Claude Opus 5.5(58)与 Sonnet 5.5(56)。
- 幻觉率成了差异化项。 在 AA-Omniscience 上 Argon 幻觉率 15%,是 Index 45 分以上模型中最低的;GPT-6 Astra(max)为 51%、GPT-6.1 Sol(max)为 54%。代价是准确率 50%,比 Gemini 3.1 Pro Preview 低 5 分。
- 价格与 token 效率被拆开。 标准价 $4/$20(每百万输入/输出 token),当前促销五折 $2/$10(至少一个月),缓存输入再享 95% 折扣约 $0.10/M。按促销价单个 Intelligence Index 任务 $1.99(Astra 的 60%,却是 GPT-6.1 Sol 的 2.7 倍),促销结束后升至 $3.98。Argon 平均每任务输出 62k token,Astra 只需 27k——便宜来自低单价,不是高效率。
- 长输出协议变了。 输出上限从 64k 提到 100 万 token(Google 称行业首创),并新增 Gemini API 的 Long Decode Continuation:暂停长响应、跨请求续传,让长推理不撞超时。输入上下文仍为 1M,支持文本、图像、视频、音频输入,但只输出文本。
- 人类偏好与消费端错位。 Arena.ai 的 Text Arena 里 Argon(High)以 1,525 分登顶,领先 Claude Opus 4.6(High)20 分;但在消费端,有付费的 Gemini app 用户表示可选的最新版本仍停在 3.6,而 3.7 在 8 月、3.8 在 9 月初就已发布。宣传版本与客户端版本脱节,本身就是分级发布期的副作用。
- 自报基准与独立评测口径不一。 Google 公布的自测基准里 Argon 在多数项目领先、有时大幅领先;Artificial Analysis 的独立结论却是「追平但未领先」。Vals Index 上 Argon 虽以 68.9% 首次登顶,但同一榜单里 Sonnet 5.5 也压过 Anthropic 自家顶配 Opus 5.5——提醒单一榜单不足以支撑采购决策。
主要来源(均以 curl 验证返回 200 并核对标题与日期):
- The Verge:Google announces Gemini 4 and says it’s so capable that only ‘trusted cyber defenders’ can have it right now
- THE DECODER:Google Gemini 4 Argon closes the gap with OpenAI and Anthropic but doesn’t take a clear lead
- Artificial Analysis:Gemini 4 Argon — Google is back as one of the top three labs in intelligence achieved
- Artificial Analysis 模型页:Gemini 4 Argon(High)
- Hacker News 讨论(1,613 分,经 Algolia API 读取)
说明:Google 官方公告页 blog.google/.../gemini-4-argon/ 在本环境持续返回超时(curl 000),未直接核验;以上事实以可访问的二手报道与独立评测为准。
为什么现在重要
1. 前沿模型发布从「GA 即开放」变成「分级 + 守卫式发布」。 能力越强,越先给经过审查的防御方,甚至暂时不给公开 API。影响:开发者不能再假设「发布日 = 可用日」,排期与 SLO 必须为 gated 模型预留回退路径。
2. 安全理由与监管配合已经合流成产品策略。 Google 一边限制访问、一边参与政府预发布流程;前一天 OpenAI 也因安全顾虑推迟了原计划的 GPT-6.1 Astra。影响:采购与合规评审要开始读「发布条款」和准入机制,而不只是模型卡。
3. 便宜是促销价,不是基本面。 五折结束成本翻倍,而且低 token 单价被高 token 消耗抵消了一半收益。影响:预算要按「每任务成本」建模,别被 $/M 的单价误导。
4. 幻觉率第一次拉开约 3 倍差距。 15% 对 51% 意味着「承认不知道」的能力成了可量化的选型维度,而不只是准确率。影响:事实类、RAG、审计类工作流值得专门针对 Argon 重跑一轮幻觉评测;但它的准确率反而比上一代低 5 分,说明「少说错」与「说得多对」是两个方向,要按场景取舍。
5. 长输出配可续传改写了 agent 调用协议。 1M token 输出加上 Long Decode Continuation。影响:超时、重试与流式消费逻辑要按「可暂停 / 可续传」重新设计,而不是简单加大 timeout。
工程师/产品人今天能做什么
- 维护一张模型可用性表:把 Argon 明确标为 gated / 未 GA,写清回退模型,并禁止它出现在对外功能承诺里。
- 预算改用每任务成本:对 $1.99(促销)与 $3.98(标准)两套数做区间,而不是照 $2/$10 算。
- 对事实性工作流做幻觉 A/B:以 15% 对 51% 为假设,用你自己的数据跑一轮,别只看公开榜单。
- 评估 Long Decode Continuation:若你有长报告、长推理场景,测「暂停—续传」接口并改造超时与重试逻辑。
- 跟踪准入路径:若业务落在安全/防御或政府交付领域,盯住 Fairwind 类「可信防御者」计划与政府预发布流程的公开细则。
待观察
- Argon 何时对公众与 API 正式开放?Google 只说「as soon as possible」,未给日期。
- 五折促销何时结束、标准价 $4/$20 何时生效?官方未公布。
- 「可信网络防御者」的准入标准,以及政府预发布流程对商用 API 可见性的实际影响,均未公开。