post cover

AI 热点快报:DeepSeek V4.1 Flash 今日上线,Pro 请求自动改道、Flash 再降价(2026-09-10)


事件与背景

9 月 9 日晚(北京时间 19:19),一封 DeepSeek 发给 API 用户的公告全文被贴到 Hacker News(约 373 分),随即成为当天 AI 板块讨论最热烈的帖子之一。公告核心内容:DeepSeek 计划于 9 月 10 日(北京时间)正式发布 V4.1 Flash 模型,官方称其在性能、成本、速度与任务完成时间等关键指标上全面超越 V4 Pro;同时承诺——自 V4.1 Flash 正式发布后、至 V4.1 Pro 发布前,所有指向 Pro 模型的请求将被自动路由到 V4.1 Flash,并按 Flash 的价格计费;Flash 系列定价自 9 月 10 日 12:00(北京时间)起调整。

评论区确认了公告的官方来源:一是 platform.deepseek.com/usage 控制台页面上的 banner,二是用户收到的官方邮件(有评论者直接回复「我收到了邮件」)。公告给出的新定价(非高峰、每百万 tokens):输入 cache hit $0.003、cache miss $0.15、输出 $0.60。对照官方定价页现行价:V4-Flash-0731 为 $0.007 / $0.22 / $0.66,V4-Pro-0813 为 $0.022 / $0.66 / $1.98(高峰时段均为两倍,高峰为北京时间周一至五 09:00-12:00 与 14:00-18:00)。也就是说,V4.1 Flash 的输出价比 V4 Pro 便宜约三分之二,输入(cache miss)价约为其四分之一。

需要注明的事实边界:本文撰写时(9 月 10 日凌晨)官方文档的模型列表仍显示 0731/0813/Vision-Exp 三个版本,尚未列出 V4.1——正式发布与调价在今日中午生效,新闻本身是「今天发生的事」。另有 HN 用户转述推特称「新模型已可被 API 召唤、但列表不显示」,属未确认信息。DeepSeek 官方文档长期写明:API 模型名指向最新版本(deepseek-v4-flash 已自动更新到 0731、deepseek-v4-pro 已更新到 0813),调用方式不变——本次「Pro 路由到 Flash」把这一惯例推到了新高度。

来源:

为什么现在重要

  1. 「Pro」不再是质量契约,而是会被自动替换的标签。 公告明确:V4.1 Flash 发布后,所有 Pro 请求先路由到 V4.1 Flash 并按 Flash 计价。你代码里写死的 deepseek-v4-pro,今天中午起实际跑的是另一个模型。影响:依赖模型名做输出格式、工具调用或长流程稳定性假设的工程,需要重新建立 eval 基线——「什么都不做」也是一种决定,但应该是知情决定。

  2. 「Flash 反超上一代 Pro」正在变成中国模型厂的默认产品节奏。 HN 评论者指出这并非史无前例:GLM-5.3 Flash 已经演示过「比 GLM-5.2 更好更便宜」(本博客 8/29 快报记录过 GLM-5.3 开源权重发布)。DeepSeek 跟进意味着这不是单次发布,而是一套可复制的战略:用新一代小模型 + 降价 + 自动迁移,吃掉自家上一代 Pro 的价格带。影响:「按代际付费」的心智开始瓦解,能力分级(Flash/Pro)从营销话术变成动态路由的工程参数。

  3. 推理成本再下一个台阶,且是「例行降价」而非促销。 V4.1 Flash 非高峰输出 $0.60(V4 Pro $1.98 的约三分之一)、cache miss 输入 $0.15、cache hit 仅 $0.003。对高 cache-hit 的 agent 循环、批量改写、检索增强类负载,token 成本正逼近可忽略区间。影响:过去因 token 单价而不经济的产品形态(大规模 agent 编排、整库处理)值得重新算一遍账。

  4. 开发者用脚投票的方向很明确。 这条「升级 + 降价」公告在 HN 拿到 373 分,评论区大量留言是「我对此比任何前沿模型发布都更兴奋——我不需要能发明新数学的模型,我要快、便宜、稳定」「如果 Flash 持续反超上一代 Pro,好日子来了」。与昨日快报记录的「LLM 证明 Euler 爆破」式前沿叙事正好形成对照:市场注意力的重心正在移向「便宜到可以规模化的日常工作模型」。

工程师/产品人今天能做什么

  1. 中午 12:00 前盘点所有走 deepseek-v4-pro 的生产请求。 分成三类:可接受自动路由的(直接享受更快更便宜)、必须锁定行为的(输出格式/工具调用/长流程有回归风险,先切到其他 provider 或固定版本)、需要先跑回归集再放行的。注意公告的措辞是「所有 Pro 请求都会被路由」,没有 opt-out。

  2. 用新旧价格重算成本模型,把默认模型降到 Flash 档。 以输出 $0.60 vs Pro $1.98、cache miss $0.15 vs $0.66 为基准,Pro 只保留为 fallback;把批处理任务排到非高峰时段(高峰价为两倍),高 cache-hit 的循环收益最大。

  3. 把「模型版本漂移」纳入 CI 监控。 DeepSeek 的 API 模型名历来自动指向最新版,本次 Pro→Flash 路由是最大一次静默换引擎。在请求日志里记录实际 model version,跑 mini-regression 集,防止行为漂移上线几天后才被发现。

  4. 一周内做一次 Flash 档盲测。 拿你的真实 agent 任务(代码生成、工具调用、长上下文)对比 DeepSeek V4.1 Flash、GLM-5.3 Flash 与 Kimi 同档模型,记录成本 × 质量 × 速度三维,据此重定默认模型——参考 8/27 快报里「Flash 档以约十分之一价格逼近前沿能力」的趋势。

  5. 关注开源与自托管路径。 社区已有开发者把 V4 Flash Vision 的 GGUF 跑在 128GB 内存设备上;V4.1 Flash 若延续开源权重传统(尚未确认),本地 fallback 与数据合规方案会立即多一个选项。

待观察

  1. V4.1 Flash 是否开源权重、何时上 Hugging Face——评论区呼声很高,官方未确认(可回访 8/29 GLM-5.3 开源的对照)。
  2. 「Pro 请求路由到 V4.1 Flash」的过渡期多长、V4.1 Pro 何时发布;路由后老 Pro 用户是否出现质量回退抱怨——HN 讨论帖评论区是现成的观察窗口。
  3. 官方文档何时把 V4.1 Flash 写入模型列表与定价页(撰写时仍显示 0731/0813),以及「新模型已可被 API 召唤但未列出」的传闻是否属实。