post cover

AI 热点快报:DeepSeek V4 Flash 0731 在 ARC-AGI-2 反超 GPT-5.6 Luna,成本仅 1/16(2026-08-08)


事件与背景

8 月 7 日,ARC Prize 官方结果页(DeepSeek V4 Flash 0731 - ARC-AGI Results,200 验证)发布 DeepSeek V4 Flash 0731 的官方验证成绩:在最大推理档(Max)下,ARC-AGI-2 Semi-Private 得分 61.4%、每任务成本约 0.04 美元;ARC-AGI-1 Semi-Private 得分 89.0%、每任务成本约 0.02 美元。同一排行榜上(ARC Prize Leaderboard,200 验证),GPT-5.6 Luna Max 在 ARC-AGI-2 为 59.5%(每任务 0.67 美元)、ARC-AGI-1 为 88.0%(每任务 0.32 美元)——即 DeepSeek 在两项基准上均反超原版 Luna Max,成本约为其 1/16;即便对比 7 月 30 日更新的新版 Luna(ARC-AGI-2 为 59.6%、每任务 0.177 美元),DeepSeek 成本仍不足其 1/4。该结果页登上 HN 首页获 534 分、318 条讨论(HN 讨论)。

模型本体:DeepSeek-V4-Flash-0731 是开源权重的 284B 参数 MoE(13B 激活)、1M 上下文、MIT 协议Baseten 模型库,200 验证)。7 月 31 日 DeepSeek 官方更新日志宣布 V4-Flash API 公测(DeepSeek 更新日志,200 验证),Agent 能力大幅提升:Terminal Bench 2.1 达 82.7、DeepSWE 54.4、Toolathlon 70.3,原生支持 Responses API 并针对 Codex 做了适配;官方同时披露 V4-Pro 正式版”即将推出”。技术报告(arXiv 2606.19348,200 验证)显示 V4 系列采用 CSA+HCA 混合注意力、mHC 超连接与 Muon 优化器,在 32T token 上预训练。

来源:

为什么现在重要

1. ARC-AGI-2 是被设计来抵抗”刷题”的基准,反超含金量高。 与 ARC-AGI-1 不同,ARC-AGI-2 刻意降低先验、压缩答案分布,专门打击记忆化与 RL 过拟合;在此基准上开源模型首次反超 OpenAI 同档旗舰,说明差距来自推理泛化的真实进展而非评测技巧。影响判断:抽象推理的”开源-闭源差距”正在以可量化的方式收窄。

2. 1/16 的成本差改写价格-性能曲线。 每任务 0.04 美元对 0.67 美元,意味着批量 Agent 场景下”同水平智能”的成本结构相差一个数量级;OpenRouter 上该模型输入 0.13 美元、输出 0.26 美元每百万 token(OpenRouter 模型页,200 验证),对高吞吐推理是直接的价格冲击。影响判断:闭源 API 的定价锚点将被开源模型的性价比持续压低。

3. 开源 + MIT + 1M 上下文,落地自由度完全不同。 权重可自托管、可审计、可微调,1M 上下文对齐旗舰规格(arXiv 技术报告);284B/13B 激活的 MoE 也让单机部署成为现实议题。影响判断:对数据敏感或成本敏感团队,“换掉闭源 API”从口号变成可执行方案。

4. 这不是基准玩具:官方数据直指 Agent 工作负载。 Terminal Bench 82.7、DeepSWE 54.4、Toolathlon 70.3,加上 Responses API 与 Codex 适配——DeepSeek 明确把 V4-Flash 定位为”干活的模型”,而非刷分模型。影响判断:Coding Agent 与工具调用场景是这场性价比竞争的主战场。

5. 竞争焦点从”谁最强”转向”谁的每分智能更便宜”。 ARC-AGI-2 榜首仍是 GPT-5.6 Sol(92.5%)、Claude Opus 5(90.4%),但每任务成本 1.4-2 美元;DeepSeek 追平的是”性价比旗舰”Luna 档。影响判断:头部梯队与性价比梯队正在分化成两个市场,产品选型的核心变量从”天花板能力”转向”单位成本能力”。

6. 第三方评测交叉印证,非单一来源。 独立评测机构 Artificial Analysis 将 DeepSeek V4 Flash 0731(Max)评为”智能领先梯队”(Intelligence Index 52,中位数 26),并指出其速度快但输出冗长(Artificial Analysis 评测,200 验证)——与 ARC 官方验证、HN 讨论中”与 Luna 相当但更便宜”的社区结论相互印证。影响判断:多方交叉验证降低了”官方刷分”疑虑,数据可信度较高。

工程师/产品人今天能做什么

  1. 用 API 试跑自己的任务:模型名 deepseek-v4-flash 已在 OpenRouter、Baseten 等上线,把团队现有 agent/eval 集(工具调用、代码生成)跑一轮,和当前闭源模型做盲测对比。

  2. 重算推理成本预算:按 ARC 每任务成本(0.04 美元 vs Luna 0.67 美元)对现有高吞吐场景做一版”换 DeepSeek”推演,量化一年可省的成本与需要接受的精度损失。

  3. 评估 Coding Agent 迁移:官方为 Codex 做了适配、原生支持 Responses API,正在搭建 coding agent 的团队值得做一次真实仓库上的对照实验。

  4. 自托管可行性评估:284B/13B 激活 MoE + 1M 上下文,对照团队 GPU 资源评估量化部署可行性;数据敏感场景可把”本地跑 Flash”作为候选架构。

  5. 建立分层模型路由:参考 ARC 的”成本-分数”曲线,把简单任务路由到 Flash 档、复杂任务留给旗舰档,先跑通路由再优化精度。

待观察

  • DeepSeek V4-Pro 正式版:官方称”即将推出”,1.6T/49B 激活的 Pro-Max 在 ARC-AGI-2 上能否冲击 90%+ 梯队,是下一个关键节点。
  • ARC-AGI-3 尚未有 DeepSeek 成绩:结果页该列为空,新一代交互式基准上的表现未知,值得追踪。
  • OpenAI 的回应:7 月 30 日新版 Luna 已出现在排行榜上(成本降至 0.177 美元/任务),是否会进一步降价或推出更激进的 Flash 级小模型,决定这场性价比竞争的走向。