AI 热点快报:Cognition 发布 SWE-2,把「性价比前沿」直接写进强化学习目标(2026-09-11)
事件与背景
9 月 10 日,Cognition 发布新一代编程 Agent 模型 SWE-2,官方标题即立场——「Pushing the Pareto Frontier」(推进帕累托前沿)。官方描述为:SWE-2 在多个 effort(推理投入)档位上提供极具竞争力的 agentic coding 表现,同时同时推进能力与推理成本的前沿。发布当日即可在 Devin Desktop 与 Devin CLI 使用,并陆续在 Devin Web 与 Fusion 上线。
核心事实(均出自官方发布文):
- 性能贴住前沿、价格拉开差距。 在 FrontierCode 1.1 Main 上 SWE-2 得 50.0%,距最强的 Fable 5.1(50.9%)仅差 1 分,但官方称便宜 64%。在 DeepSWE 1.1 上 SWE-2 得 73.0%,甚至高于 Fable 5.1(67.4%)与 Grok 4.6(67.5%)。
- RL 首次进入「数万亿参数」规模。 SWE-2 基于 Kimi K3(2.8 万亿参数)做后训练,官方称这是首次把强化学习扩展到 multi-trillion-parameter 量级。
- 单次 RL 训练同时优化全部 effort 档位。 关键新增是一种按 effort 档位施加线性成本惩罚的 RL 算法,让 medium/high/max 三档在一次训练中同时被推向成本—性能前沿。
- 效率提升是实打实的。 官方数据:SWE-2 medium 得分高于前代 SWE-1.7,却少用 58% 的步数、平均省 81% 的成本;平均每任务步数从前代 127 步降到 medium 的 53 步;在 FrontierCode 1.1 Main 上「第一次真正改代码」的中位步数从 48 步降到 18 步。
- 发布即附带对齐/可信评测。 在政治敏感话题的「宣传与审查」评测中,SWE-2 总体通过率 98.0%(英文 99.8%、简体中文 95.2%、繁体中文 99.1%);在「按客户身份/请求语言诱导写漏洞代码」的评测中,没有任何框架条件造成统计显著的脆弱性上升。
来源(均经 curl 验证返回 200):
- Cognition 官方发布文:Introducing SWE-2: Pushing the Pareto Frontier
- 前代模型技术文:SWE-1.7(作为效率对照基线)
- Cognition 信任度评测方法:Measuring the Trustworthiness of Open-Source-Derived Models
(Hacker News 当日讨论帖 item?id=49645443 约 176 分,本文抓取环境无法直连 news.ycombinator.com 验证状态,故不列为正式来源。)
为什么现在重要
-
训练目标本身变了:从「刷榜分数」转向「刷性价比曲线」。 SWE-2 的奖励函数形如
R = 成功与否 − λ·成本,且每个 effort 档位的 λ 都对准基座模型帕累托曲线的局部斜率——官方还给出了「只有线性成本惩罚才能让目标只依赖平均成本与成功率」的证明。影响判断:过去「贵一点换更高分」是默认选项,现在「前沿的形状」被直接优化,单点高分模型的商业叙事会被成本—能力曲线叙事取代。 -
RL 规模跨过万亿参数门槛,是大模型后训练的分水岭。 在 2.8T 参数基座上做 RL,官方仍称「发现可观余量」(多个基准 +5~6 分)。影响判断:post-training 的算力回报尚未见顶,拥有强基座 + 强 RL 基础设施的团队会持续拉开差距,小团队自训「媲美前沿」的窗口进一步收窄。
-
一次训练覆盖多个 effort 档位,改变了模型的交付形态。 传统做法要为「领域 × effort」组合各训一个专家再蒸馏(文中直接对比了 Kimi K3 的 multi-teacher 蒸馏路线);SWE-2 用一条成本惩罚在单次 run 里端到端训练全档位。影响判断:一个模型暴露「便宜—贵」多档将成为默认接口,产品侧可以按任务难度动态选档,这是可以直接省钱的工程杠杆。
-
「Agent 少走弯路」被量化,效率提升来自判断力而非蛮力。 官方把最大收益归因于聚焦式探索:模型能判断代码库里哪些部分真正相关,从而更早动手(18 步 vs 48 步)。影响判断:评估 Agent 时应把「步数/回合数」当作一等指标,而不只看最终解决率——两者相乘才是真实账单。
-
长程任务上差距仍巨大,冷静看「贴住前沿」的边界。 在更难的 Terminal-Bench 4 上,SWE-2 为 27.3%,远低于 Fable 5.1(55.8%)与 GPT-6 Astra(57.9%)。影响判断:SWE-2 的强项在标准工程任务的高性价比,别把它直接外推到需要长程规划的高风险场景。
工程师/产品人今天能做什么
- 把「每任务成本」加进模型选型表。 官方这次直接按
美元/任务画前沿(例如 Fable 5.1 Max 50.3% 却要 $12.83/任务,反而低于其中档 50.9% @ $3.28)。本周内给团队的 coding agent 基准补上「成本」这一列,很多「最强模型」会在你自己的任务分布上被更便宜的档位击败。 - 在 Devin CLI 上做一次分档实测。 SWE-2 已在 Devin Desktop / CLI 可用;用你真实仓库里 5~10 个典型任务,分别跑 medium 与 max,记录通过率、步数、耗时、花费四项,确定哪些任务根本用不着高档位。
- 重审你的模型路由与预算上限。 若你现在一律调用最贵档,把「简单任务降档」当成默认策略;按官方口径,medium 已在若干基准上超过前代满血版、且成本低一个数量级,这是无需换供应商就能拿到的降本。
- 给 Agent 评测补上「步数/回合」指标。 效率提升的来源是「更早编辑、更少无效探索」,把 median steps、首次编辑步数纳入 CI 或月度评测,才能感知模型换代带来的真实改善。
- 把对齐/可信评测纳入采购清单。 SWE-2 发布即附带多语言宣传/审查与「框架诱导漏洞」两类评测;把供应商是否公开此类结果、以及是否对中文场景单列,作为评估 coding agent 的固定项。
待观察
- 第三方独立复现。 FrontierCode / DeepSWE 的分数与「便宜 64%」的对照口径来自厂商自评,尚无独立榜单复现;对照物 Fable 5.1、GPT-6 Astra 的官方回应也待观察。
- Kimi K3 基座的权重与许可,以及 SWE-2 是否开源。 官方只说明「可在 Devin 产品内使用」,是否放出权重、以何种许可放出,决定了私有化部署与二次训练的可行性。
- 竞品是否跟进 cost-aware RL。 若「成本惩罚进奖励函数」被证明是可复制的通用配方,下一轮竞争将从单点分数转向「谁能提供更漂亮的帕累托曲线」,值得盯紧跟进的公告与复现论文。