post cover

AI 热点快报:25 位菲尔兹奖得主联署宣言,指 AI 公司「以解题为 benchmark」与数学严重错位(2026-09-12)


事件与背景

2026 年 9 月 11 日,菲尔兹奖得主 Terence Tao(陶哲轩) 在其博客发表《A Severe Misalignment of AI in Mathematics》(AI 与数学的严重错位),公布一份由 25 位菲尔兹奖得主联署的宣言,并将全文发布在独立站点 mathandai.org,同时开放继续签名。Tao 在文中说明:这份文本是过去一周内他们讨论的产物,并特意对照了此前的 Leiden Declaration(莱顿宣言) 做法——不同的是,这次「情况的紧迫性要求尽快发声」,因此没有走更充分协商的流程。

宣言签署者覆盖跨越近半个世纪的菲尔兹奖得主,包括 Pierre Deligne(1978)、Shigefumi Mori(1990)、Maxim Kontsevich(1998)、Terence Tao(2006)、Peter Scholze(2018)、Maryna Viazovska(2022)、Cédric Villani(2010),以及 Yu Deng(邓煜,2026) 等 25 人。

宣言的核心事实与论点(均出自 mathandai.org 原文):

  • 承认能力跃升。「近几个月 LLM 的数学能力大幅提升,已能解决众多领域的重大开放问题。」
  • 但把「解题」当 benchmark 是有害的。「AI 公司把解决数学问题作为 benchmark 来推动,对数学这门科学、对数学共同体都是有害的。AI 公司的目标与数学共同体的目标严重错位。」
  • 正确性不等于理解。 解题只是达成「概念理解与洞见」这一首要目标的工具和代理指标;「以越来越快的速度批量生产『真/假』陈述,可能摧毁沃土,而不是为新思想注入生命。」
  • 署名与抄袭风险。 这些结果往往仓促公布,没时间写严谨论文、提炼新方法、引用前人工作,「和在所有创意职业中一样,这带来了严重的署名与抄袭问题。」
  • 人类传递链不可缺。 若没有数学家愿意投入去发展与整合,AI 构想出的思想「永远不会真正活起来」。
  • 呼吁多方紧急应对。 号召数学共同体、开发这些技术的公司,以及将面对同类问题的整个社会正视此事。

来源(均经 curl 验证返回 200):

需要说明的边界:宣言正文用的是「AI 公司」(复数、泛指),并未点名任何具体公司;Tao 文中提到《经济学人》同日一篇标题为「顶尖数学家被 OpenAI 的做法激怒」的报道,但该站在本环境返回连接失败(付费/反爬),其具体指控细节未能独立核实,读者不应把标题等同于宣言内容。

为什么现在重要

  1. 争点从「AI 能不能做数学」转向「AI 做数学的方式会不会毁掉科学本身」。 这是顶级学术权威第一次以有组织的公开宣言形式,系统反对「以 benchmark 驱动科研」的模式。影响判断:评估与激励设计(eval / benchmark)从纯技术问题升级为治理问题——「刷榜」不再只是营销瑕疵,而可能面临学术共同体的合法性成本。

  2. 核心指控是「归因链断裂」,与开源界被无偿攫取的叙事同构。 宣言把矛头指向引用与署名:结果仓促公布,方法来不及被孤立、前人工作来不及被引。HN 上的高赞评论直接类比——开源开发者长期被公司拿去做成闭源 SaaS,「现在轮到数学家了」。影响判断:前沿实验室若继续拿数学 benchmark 做宣传,可能付出合作、引用与人才层面的隐性代价。

  3. 「验证通过 ≠ 理解」对工程界是可直接迁移的警告。 宣言强调解题只是理解这一首要目标的代理指标。这与当下 AI 生成代码的处境完全一致:测试/Lean 形式化验证能让「正确性」变得廉价且可机检,但理解债务会被掩盖。影响判断:对 AI 生成物,验证层与理解层必须分开治理,否则你会得到一堆通过了 CI、却没人能解释的资产。

  4. 「匆忙公布」正在稀释优先权与可见性机制。 学术里「谁先解决」是身份与资源的基础,而 AI 把产出速度推到「来不及写论文」的程度——这实质是在侵蚀这套机制。影响判断:所有依赖「先发优势 / 署名归属」的知识工作(论文、开源、设计、写作),都会经历同一次冲击。

  5. 这可能成为一种可复制的制衡样板。 25 位菲尔兹奖得主联署、开放追加签名,等于给「专家共识」装上了公开的基础设施。影响判断:未来一年很可能出现生物学、法学、医学等学科的「版本二」,形成 AI 公司必须回应的新利益相关方

工程师/产品人今天能做什么

  1. 读原文,把「能力」与「能力叙事」拆开看。 花 10 分钟读 Tao 的博客宣言全文,重点看它对「benchmark 驱动」的具体指控,而不是被标题里的「OpenAI」带节奏。
  2. 自查你的 benchmark 营销文案。 如果你的产品用数学/推理榜单做卖点,检查是否把「解题成绩」直接等同于「理解力 / 可靠性」。补一句边界说明(例如「分数反映特定评测集表现,不代表通用理解」),成本极低,能显著降低反噬风险。
  3. 在 AI 生成的代码/证明流水线里加一道「理解门禁」。 除了测试/类型/形式化验证这道机器门,增加一道人类门:改动必须有人能口头解释其原理与失败模式才允许合并。这两道门禁对应宣言里「正确性」与「理解」的区分。
  4. 起草一页内部的「AI 署名与引用政策」。 明确:AI 辅助产出的成果如何标注、如何引用其依赖的上游人类工作、对外发布时谁负责解释。宣言指出的署名问题是可预防的组织问题,不是学术圈专属。
  5. 把形式化验证工具链放进你的观察清单。 宣言把「正确性」与「理解」明确分离,意味着 Lean 之类工具会继续是热点——它们让正确性变便宜,因而让「谁理解、谁负责」变得关键。

待观察

  1. 签名是否扩散、是否上升为机构表态。 mathandai.org 目前开放追加签名(ORCID 或学术邮箱验证);关注签名人数是否显著增长,以及各国数学会、期刊编委会是否跟进——那将决定这是一次「个人联署」还是「行业立场」。
  2. AI 公司是否公开回应,以及《经济学人》报道的细节。 截至发稿未见前沿实验室对宣言的正式回应;经济学人那篇报道的内容因付费墙未能核实,其所谓「OpenAI 的做法」具体所指需以一手材料为准。
  3. Buckmaster–Alpöge 的论文与 Lean 证书是否公开。 9 月 9 日的声明称「即将公开」;这批「AI 参与、过形式化验证」的证明如何署名与引用,将是宣言论点能否被验证的第一个真实样本。