AI 热点快报:TypeSafe 发布 System One 模型 Jev——放弃生成文本,只输出带置信度的类型化决策(2026-09-17)
事件与背景
9 月 15 日,TypeSafe AI 发布公告,推出第一代 System One 模型 Jev,并开放 early access 等待名单。 创始人 Diogo Almeida 在文中自述:他在 OpenAI 参与过让语言模型可靠跟随指令、与人对话的方法研究,“这份工作最后成了 ChatGPT 背后的研究”,但他认为 chat 模型缺了一块关键拼图。TypeSafe 在隐身两年后给出的答案是:彻底放弃字符串生成。
Jev 的接口形态可以概括为「非结构化 state 进、类型化概率决策出」。开发者提交两样东西:一段 state(结构化程序状态/文本)、一组在调用前就定义好可能取值的问题;模型在一次查询里并行采样全部问题,返回带概率分布与置信度的类型化值——不是一个 token 一个 token 地自回归生成。官方文档把可用原语归为三类:Choice(从列表里选)、Score(按 rubric 打分)、Noul(判断命题真伪,返回 0–1)。因为输出结构预先固定,他们主张模型不可能产生类型错误,也不可能幻觉(这是官方的表述,见下文待观察)。
训练侧同样换了思路:不沿用 RLHF(优化人类偏好的文字),也不用 RLVR(可程序化验证的奖励),而是 RLCD — Reinforcement Learning for Calibrated Decisions,直接优化「决策 + 校准概率」。模型命名带两个注脚:System One 借自《思考,快与慢》里快而直觉的系统 1,Jev 来自威廉·斯坦利·杰文斯——他们预期智能成本每降一个数量级,就会解锁数量级更多的用例(杰文斯悖论)。
官方给出的数字都带具体口径:端到端响应 70ms–500ms,对比前沿 LLM 的 3–329 秒;定价 输入 $0.042/MTok(合 $42/十亿 token),输出免费(官方说法是「便宜到不需要计量」);首页主打的对比口径是 193.6 倍更快、444.6 倍更便宜。他们自己维护的 workflow 评测站点上,Jev 在同一组真实生产形状的工作流里拿到 67.8% 准确率、$0.0004/次、0.4 秒/次,作为参照的 Opus 5 是 73.1%、$0.1761、37.8 秒,Sol 是 74.1%、$0.0836、23.3 秒——也就是「准确率略低但成本与延迟低两到三个数量级」的帕累托位置。
这条发布在 Hacker News 首页拿到 1753 分、467 条评论,是当日最热条目。社区最集中的疑问不是「能不能用」,而是「能吃掉现有 LLM 调用的多少比例」——一位评论者估 40–70%(这是 HN 用户的个人猜测,非官方数据),另一位指出如果给它 AST,「理论上可以用来写代码」。也有人立刻质疑发布视频的剪辑细节,以及这种架构是否会被「更好编码器 + next-latent prediction 的 LLM」在后续反超。
来源(均经 curl 验证返回 200):
- TypeSafe AI:Introducing System One Models & Jev(2026-09-15,含全部技术口径与「Nuance」自我批评段落)
- TypeSafe 官方文档:Jev 与三种原语(Choice / Score / Noul 的接口定义)
- TypeSafe 公开 workflow 评测站(含每个模型逐条 accuracy / 成本 / 耗时)
- TypeSafe AI:Manifesto(为什么绕开 RLHF)
- system-one-adapter-python(用 OpenAI / Anthropic 做同名 API 的对照客户端)
- HN 讨论数据:hn.algolia.com/api/v1/items/49717558(1753 分 / 467 评论)
为什么现在重要
-
AI 的成本曲线第一次从「按 token 计费」变成「按决策计费」。 输出免费、输入 $0.042/MTok,意味着一次判断的边际成本约等于零。影响判断:过去因为成本被挡在门外的用例(对全量日志/全量订单/全量工单逐条打标、实时风控打分)现在值得重新算一遍 ROI,而不是继续做采样。
-
100ms 级延迟把 AI 从「异步后端」搬进「UX 关键路径」。 官方 demo 里有个 Doom 机器人,按约 10 次查询/秒运行、成本约 $7/小时——这类数字在 3 秒级前沿模型上是不可行的。影响判断:产品设计里「AI 不可用于实时交互」这条默认约束需要重新评估。
-
类型安全解决的是 agent 工程的头号故障源,且解决在 schema 层。 agent 事故里最常见的坏味道是幻觉出的工具调用、缺失字段、越界的枚举值;只有输出集合预先封闭、且带概率分布,代码才能在调用前就断言「不会有类型错误」。影响判断:把结构化判断从 prompt 里挪到 API 契约里,比继续在提示词里写「请只输出 JSON」更接近工程解法。
-
置信度是自动化的入场券,而不是可选项。 官方那句论证很锋利:如果一个任务模型 95% 能做对、但它不说自己处在剩下 5%,这个任务就无法自动化。Jev 每次输出都带校准概率,官方称置信度越高准确率越高。影响判断:即使你短期不换模型,也值得给关键判断加「置信度门槛 + 回退」的闸门。
-
评测口径本身在变:从榜单分数变成「workflow 上的准确率-成本-延迟曲线」。 他们把评测设计成「所有模型跑同一张计算图」,用最贵最聪明的外部模型均值做参考答案,并把偏向对手、demo 挑选有利于自己的细节全部写进「Nuance」段落。影响判断:这套「按美元和秒算准确率」的评估方式,很可能比模型本身更值得抄袭。
工程师/产品人今天能做什么
-
做一次 LLM 调用清单,标出「System One 形状」的调用。 标准很简单:输出是分类、路由、打分、抽字段、真假判断,且提示词里在反复强调 JSON 格式——凡是这类调用,都是候选。先数清楚比例,再决定是否试。
-
用官方对照适配器在本机先跑你自己的数据。
pip install 'system-one-adapter[anthropic]'后用system-one-adapter-python把同一批 state/问题交给现有 LLM,拿到你自己的 accuracy / cost / latency 三个数作为基线,别直接采信厂商的 193.6x。 -
给所有结构化决策加上置信度闸门。 把输出从「单一答案」改成「答案 + 概率」,低于阈值就走回退路径(更强模型 / 人工 / 保守默认分支)。这一步不需要换模型,但会立刻提升系统的可自动化边界。
-
在真实业务里准备一个「判定集」而不是「演示集」。 从生产日志里抽 200–500 条你真正要自动化的判断,人工标注答案,作为未来任何新模型(含 Jev)的验收集。官方评测站点的任务在你的 domain 之外,不能替代这一步。
-
申请 early access 时把网络延迟算进去。 官方明确说明评测跑在西海岸笔记本上、服务目前也部署在西海岸;如果你在亚洲或欧洲部署,把 RTT 计入总延迟再判断是否满足 100ms 级需求。
待观察
-
定价与性能的独立复测还没出现。 官方自己在公告里承认:无法证明定价没有补贴、需要长期证明可持续性,并且自家的评测跑在本地笔记本、参考答案是 GPT-6 Astra 与 Fable 5.1 的均值(偏向 OpenAI/Anthropic)、演示 query 的选取「对我们的模型有利」。这些自我披露值得肯定,但结论仍需第三方在真实负载下复现。
-
「不可能幻觉」在开放域抽取场景的边界。 类型安全只保证输出落在预定取值集合内,不保证判断本身正确;官方 FAQ 中关于训练数据来源、公开 benchmark 表现的部分尚未给出完整回答。
-
两条未能验证的同日热点已排除。 HN 首页同期的 Gemini 3.8 Live / Extended Thinking(479 分)与 Mistral × Mozilla 私密多语言 AI 浏览(431 分)两条源站在本机
curl返回 HTTP 000(连接失败),无法确认内容,按流程不作为本文来源,也不在此引用其 URL 或数据。