AI 热点快报:最便宜的那档模型突然变聪明——Claude Haiku 5.5 把「成本」从按 token 改成按任务(2026-10-09)
事件与背景
2026 年 10 月 7 日,Anthropic 发布 Claude Haiku 5.5(模型 ID claude-haiku-5-5),官方称它是「史上最便宜、最快、也最强的小模型」。这是 Haiku 产品线一年来的首次大版本更新,主要动作有三件:
- 能力翻倍:官方基准上,知识工作 GDPval-AA v2.1 从 Haiku 4.5 的 735 分升到 1620 分;AA-Briefcase v1.1 从 614 到 1578;计算机操作 OSWorld 2.1 从 15.7% 到 72.4%;终端任务 Terminal-Bench 4.0 从 0.0% 到 39.2%。
- 价格下探:官方称跑起来平均比 Haiku 4.5 便宜约 75%;同时把 Sonnet 5.5 的缓存读取价格砍半,让它在多数 agent 场景下再便宜约 20%。
- 配套权益:给 Claude Max / Team 订阅者发放每月 API 额度(Max 5x 100 美元、Max 20x 200 美元、Team 最高 500 美元池化)。它也是首款带可调 effort 档位的 Haiku 级模型,上下文窗口从 20 万扩到 100 万 token。
第三方评测机构 Artificial Analysis 给出了更关键的一层事实:Haiku 5.5 智能指数得分 43,比上一代高 26 分;在最大 effort 下略胜 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38),接近 2.8 万亿参数的开源模型 Kimi K3(44),但每个任务要消耗约 162k 输出 token,约为 GPT-6 Luna(约 50k)的 3 倍。价格结构是分档的:10 万 token 以内输入/输出为 0.10 / 0.50 美元每百万 token,超过 10 万则跳到 0.50 / 2.50 美元,整整贵 5 倍。
早期客户信号也指向同一方向:Asana 称在其 AI agent 产品的评测中,任务完成延迟下降超过 30%、每个 agent turn 的推理快达 2.5 倍;HubSpot 在一个 CRM 任务套件上拿到 92.8% 的历次最好成绩(均为厂商发布页披露)。而同一周的「便宜档」赛道上还挤着 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 以及开源的 Kimi K3——小模型不再是「够用就好」的占位品,而已成为各家正面竞争的战场。
社区反应则喜忧参半。Hacker News 上有人直言它「每个任务要 162k 输出 token,是 GLM-5.3 Flash 的两倍多」,也有人吐槽 10 万 token 的定价断点「低得离谱」;但同样有人表示会「在生产环境里用它替换 Luna」。这种分歧本身说明:能力提升是真的,而成本是否真的下降,取决于任务形态。
来源(均已用 curl 验证返回 200):
- Anthropic 官方发布页:https://www.anthropic.com/claude-haiku-5-5
- Artificial Analysis 独立评测:https://artificialanalysis.ai/articles/claude-haiku-5-5
- OpenRouter 模型页(实时价格与吞吐):https://openrouter.ai/anthropic/claude-haiku-5-5
- Hacker News 讨论(1,000+ 分):https://hn.algolia.com/api/v1/items/49996437
另:写作时核对了若干候选新闻源,其中 openai.com 索引页返回 403、ft.com 与 mathstodon.xyz 本机无法连通(000/空响应),均未采信、不作为本文事实。
为什么现在重要
-
「便宜档」第一次真能干 agent 的活。 OSWorld 从 15.7% 跳到 72.4%、Terminal-Bench 从 0% 到 39.2%,意味着「廉价模型只能做分类和摘要」的旧假设失效。影响:过去只敢交给旗舰模型的多步 agent 循环,现在可以把子任务下放给便宜档,单次运行的成本结构被整体改写。
-
性价比的计价单位从 token 转向任务。 官方卖点是「按 token 便宜 75%」,但独立实测显示它每个任务烧 160k+ token、是 Luna 的 3 倍,按任务算的便宜幅度会明显缩水。影响:拿单价表做选型会误判,必须按自己的真实任务画像重算「每任务成本」。
-
10 万 token 处有一道 5 倍价格悬崖。 输入输出一过 10 万 token,单价从 0.10/0.50 直接跳到 0.50/2.50 美元。影响:长上下文、整库 RAG、长会话 agent 的成本可能不降反升;分片、滚动摘要,或把长任务拆成多次短调用,可能比一次塞满更省。
-
小模型与开源大模型的边界被打穿。 一个 Haiku 级专有模型已咬住 2.8 万亿参数开源模型 Kimi K3 的智能分。影响:过去「要强就自托管开源大模型」的默认路径需要重估——专有小模型在延迟、运维和总成本上可能更划算。
-
订阅额度是平台锁定的一步棋。 每月 API 额度(Max 5x 100 美元 / Max 20x 200 美元 / Team 最高 500 美元)实质在鼓励把自建工具跑在 Claude 平台上。影响:要提前评估额度耗尽后的迁移成本,别把关键 agent 深绑进一个单一额度池。
工程师/产品人今天能做什么
-
用真实任务做 A/B,而不是看基准表。 挑 3–5 个线上高频任务,同一 prompt 分别打 Haiku 5.5 和现用模型,记录成功次数、输入/输出 token、端到端延迟和单任务成本,再决定是否迁移。
-
给 100k 边界加监控。 在调用处埋一个 prompt 长度埋点,逼近 10 万 token 就告警,并实测「分片 + 摘要」与「一次长输入」两条路径哪个更便宜。
-
把路由策略显式化。 用 Opus / Sonnet 负责规划与校验、Haiku 5.5 负责子任务执行(官方也建议它当 coding 子 agent),做一次「旗舰规划 + 廉价执行」的对照实验。
-
先跑回归再放量。 Hacker News 上已有工程师反馈该模型在部分任务上出现 prompt 泄漏、速度不如预期。切换前务必跑自己的回归集,再灰度放流量。
-
复审预算与额度。 如果你已在使用 Max / Team,把新增的月度 API 额度纳入成本模型,同时准备额度耗尽后的 fallback 路径。
待观察
-
Artificial Analysis 的 AutomationBench-AA 仅给出 35%,并说明这是发布前「过度拒答」的安全策略导致的低估,Anthropic 正在修复。修复后分数是否大幅回升、以及是否连带调整安全策略,值得跟进。
-
目前尚缺计入 10 万 token 阶梯价的「每任务成本」第三方数据——AA 明确表示其成本图暂未包含这 5 倍跳价,真实性价比仍待独立验证。
-
「更省 token」的营销话术与「每任务约 3 倍 token」的实测之间存在张力;token 效率会不会随 effort 档位和后续小版本改善,是判断这条产品线走向的关键节点。