post cover

DeepSeek V4 Flash 更新:284B 小模型硬刚 GPT-5.6 Terra(2026-07-31)


本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Hacker News 社区讨论 原文标题:DeepSeek-V4-Flash Update 原文链接:https://news.ycombinator.com/item?id=49119559 原文发布:2026-07-31 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。

译者按

2026 年 7 月 31 日,DeepSeek 在 API 更新日志中低调把 V4 Flash 从 Preview 转正:Terminal Bench 从 56.9 暴涨到 82.7(+25.8),Toolathlon 从 51.8 升到 70.3(+18.5),多项基准与 OpenAI 的 GPT-5.6 Terra 互有胜负,而价格仍远低于对手。消息在 Hacker News 迅速冲到 371 分、181 条评论。对中文读者而言,这场讨论的价值在于:它展示了海外开发者如何评价”小参数 + 极致性价比”路线的冲击,以及同日 GPT-5.6 Luna 降价 80% 背后暗流涌动的价格战。本文精选 20 条高赞评论,完整呈现社区对性能、本地部署、数据隐私与市场格局的争论。

正文

发帖原文

DeepSeek-V4-Flash Update https://api-docs.deepseek.com/updates/

DeepSeek 官方 API 文档更新页发布了 V4 Flash 模型的正式版更新。据 HN 发帖人 dnhkng 整理,本次更新的核心数据为:

  • Terminal Bench:56.9 → 82.7(+25.8)
  • Toolathlon:51.8 → 70.3(+18.5)
  • 与 GPT-5.6 Terra 对比:Terminal Bench Flash 82.7 vs Terra 78.4;Toolathlon Flash 70.3 vs Terra 53.1;DeepSWE Flash 54.4 vs Terra 69.6;Agents’ Last Exam Flash 25.2 vs Terra 50.4

“和 Terra 互有胜负,非常有意思。这些基准上没有明显的赢家,分数差异也很大。”

—— dnhkng(发帖人)


社区精彩评论精选

一、性能与基准:小模型逆袭大参数

1. (@wkcheng)

如果这些基准是真的、且能反映实际使用效果,那这就是一个疯狂级别的模型。这个 300B 模型超过了之前的 DS4 Pro Preview(1.8T 参数),看起来也超过了 GPT-5.6 Luna。而且即使 Luna 降价之后,它仍然比 Luna 便宜。疯狂。

2. (@ggcr)

哇,一个 200B 的模型能和 GLM-5.2 竞争、逼近 Opus 4.8,相当令人印象深刻。如果这些数字能转化为通用能力,再加上 DeepSeek 出色的缓存机制,我感觉这个模型会获得海量使用量。

3. (@kamikazechaser)

Flash 版本在 DeepSWE 上和 Sonnet 5 打平(54%)。如果属实,这可太重要了。

4. (@flysoft)

终于有一个在合理价格下拥有可用智力的模型了。想想 Pro 正式版会是什么样——毕竟 Pro Preview 只有 1.6T 参数。

5. (@KronisLV)

好奇正式版 V4 Pro 会有多强。我还在考虑要不要买 Kimi K3 的年费订阅,但即使是他们的 Vivace 套餐,有时也比 Anthropic 慢;GLM 5.2 的 Coding 订阅 token 限额又太容易用光了。

二、实际使用体验:便宜、快、够用

6. (@f311a)

我 90% 的任务都在用 Flash 模型。它比 Pro 还好用(原因不明),非常便宜而且快。我把每次改动控制在 1000 行以内,架构决策自己拍板,和前沿模型几乎感觉不到差别。剩下 10% 用来找 bug、安全问题、研究更好的架构,Flash 也做得很好,我只是交叉验证一下。对我来说,更快的迭代比什么都强,我讨厌为小改动等 5-10 分钟。我试过最近的 Kimi 和 GLM,但它们无谓地思考太多,因此很慢。我还经常往里灌大量数据而不用担心限额:依赖(找瓶颈)、日志、性能转储等等。而且它从不会抱怨安全护栏——我一直在用它逆向工程二进制文件。

7. (@lionkor)

我很多日常 agent 需求都用 DeepSeek,直接放数据说话,过去 30 天:费用 $4.55,API 请求 3,467 次,token 323,183,886。作为一个带小团队的技术负责人,我对质量要求很高,个人项目也一样。编码和代码审查任务它从没让我失望。其他任务,用别的模型。

8. (@egeozcan)

每次我想用自然语言处理搞点好玩的编码,都用 DeepSeek flash。这个价格简直不可思议。我有一个 400 用户的 App 后台跑 DeepSeek,一个月都没超过 50 美元。

9. (@kmarc)

我现在基本在 pi 里全部跑 flash。配上一套正确的 MCP server、上下文精简工具和 skills,任何任务它都能实现。有些会话要 30+ 轮,但快又便宜;一小时全搞定,成本约 $0.5。(不过说实话,我的多子代理工作流里,规划、审查、当”预言机”还是用更贵的模型。)我几周没用我们那个慢吞吞的 opus 订阅了。(还搭了个 OpenWebUI 自托管聊天,手机能用,带 MCP 和 skills,彻底替代了 Perplexity。月成本约 $18 含托管和订阅。)

10. (@mordae)

它发布时我正好在用。突然推理就变得更充分了,精度也大幅提升,连文风都变好了。期待权重发布。

11. (@sqemo)

DeepSeek 对我熟悉的任务和软件很好用。就算它出错,我通常也能自己验证。但当我用不熟悉的编程语言时,我更喜欢 Codex 或 Claude。

12. (@Reubend)

他们的更新说明总是非常低调。这实际上是模型能力的一次巨大提升,而不是小修小补。

13. (@NitpickLawyer)

我个人觉得这比 K3 更令人兴奋。DSv4 模型部署成本极低。能力提升会带来大量下游效应,因为”够用”的任务越来越多。DS 长期以极低价格提供 Pro 版,还和 opencode 等提供商集成,很可能从真实开发者那里积累了海量真实任务数据(在 OpenRouter 上他们就是这么标注的)。现在他们可以用这些真实场景继续 post-train 模型。我很期待把 K3 蒸馏进 DSv4 会不会带来进一步改进。总之,又快又便宜的模型持续变好,对社区是大利好——尤其它们不会因为提供商一时兴起就”消失”,能力可以”永远”用下去。而且 Flash 至少可以”在家”用不到 1 万美元的硬件跑,这对 GLM/K3 那种更大的模型来说基本不可能。

三、本地部署与权重

14. (@spwa4)

想自己跑的话,它是 DeepSeek-V4-Flash-284B-A13B。单张 B300 勉强能跑,M5 Max 上也勉强能塞下。

15. (@arjie)

天哪这更新太棒了。我需要这些权重。按这个体积来说它强得离谱。改进后的工具调用等能力能让我的 harness 简单很多。它在 2x RTX Pro 6000 这种准专业硬件上跑得飞快。

16. (@Tepix)

听起来是个大改进。但只提了 API,没提权重。更新后的权重什么时候发布?

17. (@wolttam)

万岁!这个模型让我对本地推理的未来非常乐观。CyberGym 的分数尤其亮眼。

四、隐私、安全与地缘政治

18. (@baalimago)

非常有前景。既保持速度和降价,性能又超过已经相当够用的 deepseek-v4-pro?在智能/成本指数上应该会继续扩大领先——deepseek-v4-flash 本来就是性价比最高的模型,现在更好了。不过,用 DeepSeek API 意味着代码库的所有信息都会泄露给中国。

19. (@XCSme)

现在没法用它,除非你不在乎交出数据:> 训练:该提供商可能使用提示词进行训练,并可能保留提示词数据。

20. (@nickandbro)

我不怀疑 GPT-4.6 Luna 在”每智能成本指数”(Cost per Intelligence Index)左上象限的中心位置会让梁文锋感到担忧。但要记住,DeepSeek v4 flash 虽然便宜一点,但没有视觉能力——而视觉对 agent 类任务是个大卖点。我欣赏 DeepSeek 的开放,但就连他们也在折扣后涨价了。

21. (@dakolli)

中国实验室这周急着发模型,因为华盛顿在接下来 4 周内几乎必然要管制中国模型。美国所有 AI 巨头这周都在往华盛顿跑,你觉得他们是去干嘛的……

五、命名吐槽与市场反应

22. (@PhilippGille)

之前的 V4 版本大多数推理提供商都不叫”Preview”。比如 OpenRouter 的模型 slug 就是 deepseek/deepseek-v4-flash。所以现在大家聊 V4 Flash 或有人提供 V4 Flash 推理时会有混淆。为什么不叫 V4.1?

23. (@yewenjie)

是什么阻止他们叫它 v4.1-Flash 以便更好区分?

24. (@sim04ful)

为什么至少不作为一个 patch 更新来递增版本号?

25. (@znnajdla)

我内心的阴谋论者想说:今天 GPT 5.6 Luna 价格暴跌 80% 和这个 DeepSeek 更新是有关联的。也许 OpenAI 已经用类似 Mythos 的模型”黑”进了竞争对手,提前知道对手在做什么,能提前应对。

26. (@sourcecodeplz)

我做了一个它和 GPT Luna(最近降价 80%)的对比:https://x.com/SourceCodeplz/status/2083099712760987746 说实话我更喜欢 GPT-5.6 Luna。

27. (@Goranek)

贵的东西用 Kimi K3(代替 Opus),任务用 DSV4 Flash(代替 Sonnet)?这样搭配合理吗?

28. (@miyuru)

从今天的 OpenRouter 排行榜看,Dv4F 比 mimov2.5 更受欢迎。https://openrouter.ai/rankings?view=day#leaderboard-table 现在”每任务成本”更重要,SOTA 模型太贵了。


译者注

  1. Terminal Bench / Toolathlon / DeepSWE / Agents’ Last Exam:四个 2026 年常见的 agent 能力基准。Terminal Bench 测终端/命令行任务执行;Toolathlon 测工具调用(function calling)综合能力;DeepSWE(Deep Software Engineering)测真实软件工程任务;Agents’ Last Exam 测 agent 在长尾知识问答上的表现。发帖人 dnhkng 整理的对比显示,Flash 在终端任务和工具调用上反超 Terra,但在软件工程和知识问答上落后。
  2. DeepSeek-V4-Flash-284B-A13B:MoE(混合专家)架构,总参数 284B、每次激活 13B。评论中”300B / 200B”的说法都指总参数规模——这正是它能在单张 B300 或 M5 Max 上勉强运行的直接原因(激活参数少,显存占用低)。作为对比,DS4 Pro Preview 是 1.6-1.8T 参数。
  3. GPT-5.6 Terra / Luna:OpenAI 2026 年的两个模型系列。Terra 定位高端(价格较高),Luna 定位低价高效;同日(7 月 30-31 日)Luna 宣布降价 80%,被多位评论者与 DeepSeek 的这次更新联系起来。
  4. pi / opencode / MCP:pi 是社区流行的开源编码 agent;opencode 是另一个开源 agent 框架;MCP(Model Context Protocol)是 Anthropic 提出的模型上下文协议,用于给 agent 接外部工具。多位评论者用”pi + MCP + skills”搭建了个人 agent 工作流。
  5. 梁文锋(Liang Wenfeng):DeepSeek 创始人。评论者 nickandbro 借用”Cost per Intelligence Index”(每智能成本指数,即单位智能所需成本)说明 DeepSeek 的性价比定位给 OpenAI 带来的压力。
  6. CyberGym:网络安全能力基准,评论者 wolttam 认为 Flash 在该基准上的表现说明其安全能力(如抵御越狱)值得期待。
  7. mimov2.5:MiniMax(稀宇科技)的模型,在 OpenRouter 日榜上长期靠前,评论者观察到 V4 Flash 热度已超过它。
  8. 数据隐私提醒:DeepSeek API 条款中”可能使用提示词进行训练并保留提示词数据”的表述,是海外开发者使用时的最大顾虑之一(评论 18、19);中文开发者若涉及敏感代码,同样建议评估自部署或隐私条款。

延伸阅读