post cover

DeepSeek V4 Pro 0813 发布:API 独供、涨价在即,HN 963 分热议性价比与推理档位(2026-08-13)


本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:DeepSeek V4 Pro 0813 (on OpenRouter) 原文链接:https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/ 原文发布:2026-08-12 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。

【译者按】

DeepSeek 又一次以”闷声发大财”的方式上线了新模型:8 月 13 日,DeepSeek V4 Pro 0813 仅通过 API 提供(OpenRouter 抢先上架),官方连个像样的公告页都没有。但它的价格极具杀伤力——评论区实测约比 Opus 4.8 便宜 20 倍,直接把这条消息顶到 Hacker News 第二名(963 分 / 410 评论)。本文翻译 Simon Willison 的即时点评:他注意到该模型低/中/高三档推理设置画出的鹈鹕差异极大(此前从未在其他模型上见过),并梳理了评测数据从 DeepSeek 官方微信群 → Reddit(被删)→ HN 的传播链——这本身就是中文圈”微信群发布、海外发酵”现象的绝佳样本。对中文圈读者来说,这篇的价值在于:V4 Pro 0813 定价与 V4 Flash 0731(本博客 07-31 已翻译)形成”涨价在即”的连续剧,而评论区围绕性价比、pass@1 可靠性、数据出境等话题的争论,恰好与国内开发者关心的问题同频。

【正文】

DeepSeek V4 Pro 0813(on OpenRouter)(2026 年 8 月 12 日 · Link Blog)

最新的 DeepSeek Pro 模型现已可用,仅通过 API 提供。我不得不链接到 OpenRouter,因为 DeepSeek 没有为他们这款新模型准备任何像样的公告页面。

我还无法确认他们是否计划发布开放权重,但鉴于 4 月的 deepseek-ai/DeepSeek-V4-Pro 和 7 月的 deepseek-ai/DeepSeek-V4-Flash-0731 权重都已经放出,看起来很有可能。

有意思的是,我在低、中、高三个不同的推理档位下得到了看起来非常不同的鹈鹕。我还没有从其他任何模型上注意到过这种差异:

低(Low):

扁平矢量插画:一只白色鹈鹕,橙色大喙,戴着橙色条纹的草帽,骑着青绿色公路自行车,侧身骑行,背景是浅奶油色圆形,带虚线轮廓和向后拖曳的小运动线条。

中(Medium):

类似的卡通鹈鹕骑车,画风更松散、以线条勾勒:鸟身大部分是白色线稿,橙色喉囊张开,黄色帽子下挂着,一条长长的红色舌头向后飘向黄色太阳,绿色自行车把手上放着一只小蓝鱼,车轮画成断开的黄色弧线。

高(High):

鹈鹕再次出现,这次骑着红色自行车,背景浅蓝,喙与喉囊亮黄色,车尾插着紫色三角旗,柳条前篮里装着一条小鱼,右上角飘着黑色音符。

至于基准测试……据我所知,这些数据先发布在 DeepSeek 官方微信群,然后被复制粘贴到 Reddit 的一个帖子(被版主以”低质量”为由删除),再被复制进 Hacker News 上的这张 ASCII 表格

以下为 HN 评论 @scrlk 贴出的完整基准表(CC BY-NC-SA 4.0 讨论帖内容):

基准DS-V4-Pro 0813DS-V4-Flash 0731DS-V4-Pro PreviewDS-V4-Flash PreviewGLM-5.2Kimi-K3Opus-4.8Fable 5(含 fallback)
HLE(无/有工具)42.7/60.037.8/51.537.7/48.234.8/45.140.5/54.743.5/56.049.8/57.953.3/63.0
Terminal Bench 2.187.982.772.161.881.088.385.088.0
NL2Repo61.554.238.539.448.9-69.7-
Cybergym83.376.752.738.7-80.078.383.1
DeepSWE62.754.412.87.346.267.558.070.0
Toolathlon-Verified74.170.355.949.759.976.576.277.9
Agents’ Last Exam25.725.216.515.823.827.625.7-
AutomationBench(Public)31.825.112.810.812.930.827.229.1
DSBench-FullStack71.168.741.837.061.873.771.677.2
DSBench-Hard67.259.631.125.854.563.071.768.3

【社区精彩评论精选】(Hacker News 热帖 963 分 / 410 评论)

以下评论来自 Hacker News 讨论帖(CC BY-NC-SA 4.0),按内容质量精选:

@aabdi链接):定价页显示,它和 Opus 4.8 有竞争力,但弱于 Sol 或 Fable。价格大约便宜 20 倍。

@jklmnopqrstuvw链接):在 Codex CLI 里同时测了 DS V4 Pro 0813 和 Grok 4.6(都走 OpenRouter),给我的项目做同一个新功能开发。DeepSeek 4 Pro:干了 12 分 02 秒,花费 $0.12,有 bug。Grok 4.6:干了 3 分 18 秒,花费 $1.41,没 bug。

@freakynit链接):刚通过 OpenRouter 测了,给完全相同的任务:扫描现有仓库,生成一个 docker-compose 文件部署到 caddy 服务器后面,某些端口段已被占用,服务需要从外部签发通配符证书,PostgreSQL 需要内置……我同时测了这个模型和 gpt-5.6-terra-high。结果:这个模型出了一些问题,terra 一个都没有。这些结果和我之前用最新 Flash 版的观察一致。基准测试说的和我的实际观察不一样。项目简单的时候它们还不错……一旦复杂就不行了。

@minraws链接):DeepSeek V4 Pro 0813 是我试过的最不可靠的模型。它在 pass@3 上出奇地好——论任务完成率你也许能让它追平 Sol 或 Fable——但 pass@1 一塌糊涂,非常容易出错,绝大多数基准都表现糟糕。我不确定原因,但我怀疑可能是 GRPO。

@simjnd链接):DeepSeek V4 Flash 0731 以这么小的模型(和价格)实现了如此巨大的能力跃升,以至于我对这次发布有点失望。我给我的 Agent 拴着很短的缰绳,用它们高度交互地头脑风暴、讨论架构,然后写代码(尤其是原型),Flash 在我需要的一切上都碾压。也许我的野心比起需要 Fable/Sol 级模型的人太 tame 了,但可预见的未来我大概会留在 Flash,不升 Pro。

@hemkeshr链接):我对 V4 Pro 期望很高,尤其是 V4 Flash 0731 在同类 Flash 模型里表现那么出色。结果真令人失望。

@nthypes链接):在近一半的基准上仍然落后于 Kimi-K3。

@Gecko4072链接):正在官方 DeepSeek API 上飞速烧钱。而且他们从今天开始涨价。V4 Flash 0731 仍然感觉是过去几个月(可能还有未来)最出众的模型。

@monster_truck链接):让它在我的交通模拟器/分布式物理引擎上全力跑了一整天(2B token 花了约 $12.50,50% 缓存命中),它找到了一些相当显著的优化空间,而且没有引入任何新问题。我很满意。

@yipinwong链接):比 Luna 差,还比 Luna 贵。继续用 Luna,不把我的数据发给 DeepSeek(中国)。

@eshack94链接):看来目前唯一可用的端点(写这条时)要求你在 OpenRouter 隐私设置里开启”允许使用请求数据训练的付费端点”。希望很快出现不拿数据训练的其他付费供应商。

@schmorptron链接):过去的 DeepSeek 模型和现在这些新 checkpoint 在 ArtificialAnalysis 的 AA-Omniscience 和幻觉率基准上得分都很差。不知道原因是什么?也许他们比其他家更过度押注编码?我在(编码)使用中还没注意到这一点,有人见过它比其他模型更容易编造潜在根因或其他臆测内容吗?

@LeonKnst链接):我觉得有趣的是,采用率受”势头”影响有多大。这些中国模型有些能力出奇地强,但开发者往往默认选择那些已经是”行业标准”的模型。

@xbmcuser链接):你们读小字了吗?他们计划未来大幅提价。

【译者注】

  1. OpenRouter:聚合多家 LLM API 的中转平台,统一接口按量计费,常是模型”抢先首发”的渠道。DeepSeek 官方没有为新模型做公告页,因此 Simon 只能链到 OpenRouter 的商品页。
  2. “推理档位”(reasoning levels):API 里的 low/medium/high 参数,控制模型在回答前进行多少推理(thinking)计算。Simon 发现三档画出的鹈鹕差异极大——低档是扁平矢量、高档多了三角旗和音符等细节——这是他”鹈鹕基准”系列的新发现(本博客 07-17 已翻译过他对 Kimi K3 的鹈鹕测试)。
  3. 基准术语速查:HLE(Humanity’s Last Exam,人类终极考试,无/有工具两档);Terminal Bench 2.1 测终端/命令行 Agent 任务;NL2Repo 测从自然语言生成整个代码仓库;Cybergym 测网络安全任务;DeepSWE 测深度软件工程(真实 issue 修复);Toolathlon-Verified 测工具调用;Agents’ Last Exam / AutomationBench 测 Agent 通用能力;DSBench 测全栈与困难级开发。表格里 Kimi-K3 的 NL2Repo/Agents’ Last Exam 为空,是官方未公布,不代表 0。
  4. pass@1 与 GRPO:pass@1 指模型”一次尝试就成功”的概率;@minraws 的观察是 V4 Pro 0813 pass@3(多次采样取最优)很强但 pass@1 很弱,即”单次输出不稳定、靠多次采样兜底”。GRPO 是 DeepSeek 开源的强化学习算法(Group Relative Policy Optimization),被怀疑与这种”多尝试才稳定”的行为有关。
  5. “涨价在即”的定价连续剧:评论区多人提到 DeepSeek 当天开始上调 API 价格、未来还会大幅提价。这与 V4 Flash 0731”白菜价小模型”的定位形成对照——也解释了为什么有人抢在涨价前冲量(@cjg007:“在 V4 Pro 0813 涨价之前,我预计会有一波疯狂流量,希望服务器撑得住”)。
  6. 与中文圈生态的对照:评测数据从 DeepSeek 官方微信群流出 → Reddit r/LocalLLaMA 被删 → HN ASCII 表格,印证了国内 AI 圈”官方群发布、海外二次发酵”的典型传播路径;评论区反复出现的 Kimi-K3 / GLM-5.2 / Qwen 与 Luna(另一款中国出海模型)对比,也说明海外开发者正把中国模型群当作性价比主力。数据出境顾虑(@yipinwong 不愿把数据发给中国的 DeepSeek)则是海外视角下绕不开的议题。

【延伸阅读】