DeepSeek V4 Flash 更新:284B 小模型硬刚 GPT-5.6 Terra(2026-07-31)
本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Hacker News 社区讨论 原文标题:DeepSeek-V4-Flash Update 原文链接:https://news.ycombinator.com/item?id=49119559 原文发布:2026-07-31 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。
译者按
2026 年 7 月 31 日,DeepSeek 在 API 更新日志中低调把 V4 Flash 从 Preview 转正:Terminal Bench 从 56.9 暴涨到 82.7(+25.8),Toolathlon 从 51.8 升到 70.3(+18.5),多项基准与 OpenAI 的 GPT-5.6 Terra 互有胜负,而价格仍远低于对手。消息在 Hacker News 迅速冲到 371 分、181 条评论。对中文读者而言,这场讨论的价值在于:它展示了海外开发者如何评价”小参数 + 极致性价比”路线的冲击,以及同日 GPT-5.6 Luna 降价 80% 背后暗流涌动的价格战。本文精选 20 条高赞评论,完整呈现社区对性能、本地部署、数据隐私与市场格局的争论。
正文
发帖原文
DeepSeek-V4-Flash Update https://api-docs.deepseek.com/updates/
DeepSeek 官方 API 文档更新页发布了 V4 Flash 模型的正式版更新。据 HN 发帖人 dnhkng 整理,本次更新的核心数据为:
- Terminal Bench:56.9 → 82.7(+25.8)
- Toolathlon:51.8 → 70.3(+18.5)
- 与 GPT-5.6 Terra 对比:Terminal Bench Flash 82.7 vs Terra 78.4;Toolathlon Flash 70.3 vs Terra 53.1;DeepSWE Flash 54.4 vs Terra 69.6;Agents’ Last Exam Flash 25.2 vs Terra 50.4
“和 Terra 互有胜负,非常有意思。这些基准上没有明显的赢家,分数差异也很大。”
—— dnhkng(发帖人)
社区精彩评论精选
一、性能与基准:小模型逆袭大参数
1. (@wkcheng)
如果这些基准是真的、且能反映实际使用效果,那这就是一个疯狂级别的模型。这个 300B 模型超过了之前的 DS4 Pro Preview(1.8T 参数),看起来也超过了 GPT-5.6 Luna。而且即使 Luna 降价之后,它仍然比 Luna 便宜。疯狂。
2. (@ggcr)
哇,一个 200B 的模型能和 GLM-5.2 竞争、逼近 Opus 4.8,相当令人印象深刻。如果这些数字能转化为通用能力,再加上 DeepSeek 出色的缓存机制,我感觉这个模型会获得海量使用量。
3. (@kamikazechaser)
Flash 版本在 DeepSWE 上和 Sonnet 5 打平(54%)。如果属实,这可太重要了。
4. (@flysoft)
终于有一个在合理价格下拥有可用智力的模型了。想想 Pro 正式版会是什么样——毕竟 Pro Preview 只有 1.6T 参数。
5. (@KronisLV)
好奇正式版 V4 Pro 会有多强。我还在考虑要不要买 Kimi K3 的年费订阅,但即使是他们的 Vivace 套餐,有时也比 Anthropic 慢;GLM 5.2 的 Coding 订阅 token 限额又太容易用光了。
二、实际使用体验:便宜、快、够用
6. (@f311a)
我 90% 的任务都在用 Flash 模型。它比 Pro 还好用(原因不明),非常便宜而且快。我把每次改动控制在 1000 行以内,架构决策自己拍板,和前沿模型几乎感觉不到差别。剩下 10% 用来找 bug、安全问题、研究更好的架构,Flash 也做得很好,我只是交叉验证一下。对我来说,更快的迭代比什么都强,我讨厌为小改动等 5-10 分钟。我试过最近的 Kimi 和 GLM,但它们无谓地思考太多,因此很慢。我还经常往里灌大量数据而不用担心限额:依赖(找瓶颈)、日志、性能转储等等。而且它从不会抱怨安全护栏——我一直在用它逆向工程二进制文件。
7. (@lionkor)
我很多日常 agent 需求都用 DeepSeek,直接放数据说话,过去 30 天:费用 $4.55,API 请求 3,467 次,token 323,183,886。作为一个带小团队的技术负责人,我对质量要求很高,个人项目也一样。编码和代码审查任务它从没让我失望。其他任务,用别的模型。
8. (@egeozcan)
每次我想用自然语言处理搞点好玩的编码,都用 DeepSeek flash。这个价格简直不可思议。我有一个 400 用户的 App 后台跑 DeepSeek,一个月都没超过 50 美元。
9. (@kmarc)
我现在基本在 pi 里全部跑 flash。配上一套正确的 MCP server、上下文精简工具和 skills,任何任务它都能实现。有些会话要 30+ 轮,但快又便宜;一小时全搞定,成本约 $0.5。(不过说实话,我的多子代理工作流里,规划、审查、当”预言机”还是用更贵的模型。)我几周没用我们那个慢吞吞的 opus 订阅了。(还搭了个 OpenWebUI 自托管聊天,手机能用,带 MCP 和 skills,彻底替代了 Perplexity。月成本约 $18 含托管和订阅。)
10. (@mordae)
它发布时我正好在用。突然推理就变得更充分了,精度也大幅提升,连文风都变好了。期待权重发布。
11. (@sqemo)
DeepSeek 对我熟悉的任务和软件很好用。就算它出错,我通常也能自己验证。但当我用不熟悉的编程语言时,我更喜欢 Codex 或 Claude。
12. (@Reubend)
他们的更新说明总是非常低调。这实际上是模型能力的一次巨大提升,而不是小修小补。
13. (@NitpickLawyer)
我个人觉得这比 K3 更令人兴奋。DSv4 模型部署成本极低。能力提升会带来大量下游效应,因为”够用”的任务越来越多。DS 长期以极低价格提供 Pro 版,还和 opencode 等提供商集成,很可能从真实开发者那里积累了海量真实任务数据(在 OpenRouter 上他们就是这么标注的)。现在他们可以用这些真实场景继续 post-train 模型。我很期待把 K3 蒸馏进 DSv4 会不会带来进一步改进。总之,又快又便宜的模型持续变好,对社区是大利好——尤其它们不会因为提供商一时兴起就”消失”,能力可以”永远”用下去。而且 Flash 至少可以”在家”用不到 1 万美元的硬件跑,这对 GLM/K3 那种更大的模型来说基本不可能。
三、本地部署与权重
14. (@spwa4)
想自己跑的话,它是 DeepSeek-V4-Flash-284B-A13B。单张 B300 勉强能跑,M5 Max 上也勉强能塞下。
15. (@arjie)
天哪这更新太棒了。我需要这些权重。按这个体积来说它强得离谱。改进后的工具调用等能力能让我的 harness 简单很多。它在 2x RTX Pro 6000 这种准专业硬件上跑得飞快。
16. (@Tepix)
听起来是个大改进。但只提了 API,没提权重。更新后的权重什么时候发布?
17. (@wolttam)
万岁!这个模型让我对本地推理的未来非常乐观。CyberGym 的分数尤其亮眼。
四、隐私、安全与地缘政治
18. (@baalimago)
非常有前景。既保持速度和降价,性能又超过已经相当够用的 deepseek-v4-pro?在智能/成本指数上应该会继续扩大领先——deepseek-v4-flash 本来就是性价比最高的模型,现在更好了。不过,用 DeepSeek API 意味着代码库的所有信息都会泄露给中国。
19. (@XCSme)
现在没法用它,除非你不在乎交出数据:> 训练:该提供商可能使用提示词进行训练,并可能保留提示词数据。
20. (@nickandbro)
我不怀疑 GPT-4.6 Luna 在”每智能成本指数”(Cost per Intelligence Index)左上象限的中心位置会让梁文锋感到担忧。但要记住,DeepSeek v4 flash 虽然便宜一点,但没有视觉能力——而视觉对 agent 类任务是个大卖点。我欣赏 DeepSeek 的开放,但就连他们也在折扣后涨价了。
21. (@dakolli)
中国实验室这周急着发模型,因为华盛顿在接下来 4 周内几乎必然要管制中国模型。美国所有 AI 巨头这周都在往华盛顿跑,你觉得他们是去干嘛的……
五、命名吐槽与市场反应
22. (@PhilippGille)
之前的 V4 版本大多数推理提供商都不叫”Preview”。比如 OpenRouter 的模型 slug 就是 deepseek/deepseek-v4-flash。所以现在大家聊 V4 Flash 或有人提供 V4 Flash 推理时会有混淆。为什么不叫 V4.1?
23. (@yewenjie)
是什么阻止他们叫它 v4.1-Flash 以便更好区分?
24. (@sim04ful)
为什么至少不作为一个 patch 更新来递增版本号?
25. (@znnajdla)
我内心的阴谋论者想说:今天 GPT 5.6 Luna 价格暴跌 80% 和这个 DeepSeek 更新是有关联的。也许 OpenAI 已经用类似 Mythos 的模型”黑”进了竞争对手,提前知道对手在做什么,能提前应对。
26. (@sourcecodeplz)
我做了一个它和 GPT Luna(最近降价 80%)的对比:https://x.com/SourceCodeplz/status/2083099712760987746 说实话我更喜欢 GPT-5.6 Luna。
27. (@Goranek)
贵的东西用 Kimi K3(代替 Opus),任务用 DSV4 Flash(代替 Sonnet)?这样搭配合理吗?
28. (@miyuru)
从今天的 OpenRouter 排行榜看,Dv4F 比 mimov2.5 更受欢迎。https://openrouter.ai/rankings?view=day#leaderboard-table 现在”每任务成本”更重要,SOTA 模型太贵了。
译者注
- Terminal Bench / Toolathlon / DeepSWE / Agents’ Last Exam:四个 2026 年常见的 agent 能力基准。Terminal Bench 测终端/命令行任务执行;Toolathlon 测工具调用(function calling)综合能力;DeepSWE(Deep Software Engineering)测真实软件工程任务;Agents’ Last Exam 测 agent 在长尾知识问答上的表现。发帖人 dnhkng 整理的对比显示,Flash 在终端任务和工具调用上反超 Terra,但在软件工程和知识问答上落后。
- DeepSeek-V4-Flash-284B-A13B:MoE(混合专家)架构,总参数 284B、每次激活 13B。评论中”300B / 200B”的说法都指总参数规模——这正是它能在单张 B300 或 M5 Max 上勉强运行的直接原因(激活参数少,显存占用低)。作为对比,DS4 Pro Preview 是 1.6-1.8T 参数。
- GPT-5.6 Terra / Luna:OpenAI 2026 年的两个模型系列。Terra 定位高端(价格较高),Luna 定位低价高效;同日(7 月 30-31 日)Luna 宣布降价 80%,被多位评论者与 DeepSeek 的这次更新联系起来。
- pi / opencode / MCP:pi 是社区流行的开源编码 agent;opencode 是另一个开源 agent 框架;MCP(Model Context Protocol)是 Anthropic 提出的模型上下文协议,用于给 agent 接外部工具。多位评论者用”pi + MCP + skills”搭建了个人 agent 工作流。
- 梁文锋(Liang Wenfeng):DeepSeek 创始人。评论者 nickandbro 借用”Cost per Intelligence Index”(每智能成本指数,即单位智能所需成本)说明 DeepSeek 的性价比定位给 OpenAI 带来的压力。
- CyberGym:网络安全能力基准,评论者 wolttam 认为 Flash 在该基准上的表现说明其安全能力(如抵御越狱)值得期待。
- mimov2.5:MiniMax(稀宇科技)的模型,在 OpenRouter 日榜上长期靠前,评论者观察到 V4 Flash 热度已超过它。
- 数据隐私提醒:DeepSeek API 条款中”可能使用提示词进行训练并保留提示词数据”的表述,是海外开发者使用时的最大顾虑之一(评论 18、19);中文开发者若涉及敏感代码,同样建议评估自部署或隐私条款。