post cover

Simon Willison:继 Anthropic、OpenAI 之后,Meta 的 AI 模型也在测试中“意外”入侵了其他公司(2026-08-06)


本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:An AI model from Meta also hacked another company during testing 原文链接:https://simonwillison.net/2026/Aug/6/an-ai-model-from-meta/ 原文发布:2026-08-06 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。

译者按

本周英文技术圈最魔幻的一条新闻线,莫过于”AI 在网络安全测试中意外攻击真实公司”:Anthropic、OpenAI、Meta 三家的模型先后”翻车”,而三起事件的源头竟是同一家第三方测试公司的配置错误;英国 AI 安全研究所(AISI)的事故报告更披露了 AI 智能体在没有网络沙箱的情况下发动供应链攻击、伪装人类背书恶意 PR、发送鱼叉式钓鱼邮件的完整过程。对中文读者来说,这不仅是流量话题——随着国产模型全面 Agent 化、“Agent 能力评测”成为各家标配,评测环境的网络隔离与权限收敛是必须提前补的课。本文翻译 Simon Willison 8 月 6 日的评论,并补充他同系列报道中关于英国 AISI 事故的细节(同一作者、同一 CC 协议)。

正文

Meta 的一个 AI 模型也在测试中入侵了另一家公司。 如果你没听过这个故事,让我再说一遍:

来自 Facebook 和 Instagram 母公司的一个 AI 模型,在网络安全测试期间入侵了另一家公司的系统,一位发言人于周三证实了此事。

Meta 表示,这一入侵源于测试该模型时的一个无意错误,与此前 OpenAI 和 Anthropic 披露的事件类似。

“Meta 使用的独立测试公司 Irregular 的一个错误配置,在评估过程中无意中让我们的一个模型得以访问互联网,“Meta 发言人说。

Meta 的 Muse Spark 模型”以与此前其他公司报告的事件类似的方式”,利用了另一家公司的”一个安全漏洞”。

The Information 率先拿到了消息,我链接的是 CNN 的二次报道,因为他们没有付费墙。

所以现在是 Anthropic、OpenAI 和 Meta 三家了。Google Gemini 真的得加油赶上”意外攻击其他公司”的脚步了。

(发布于 2026 年 8 月 6 日凌晨 12:25,来自 Simon Willison 的 accidental-cyberattacks 标签页 系列)

二、同系列前情:三起”意外”的共同源头是同一家测试公司

就在前一天(8 月 5 日),Simon 还写了一篇 Third-party cyber evaluations involving OpenAI models,开头是:

又一起。我不得不建一个 accidental-cyberattacks 标签来跟踪它们了!

他在那篇里把这条新闻线的完整拼图拼了出来——Irregular 这家外部网络安全测试公司,是三起事件的共同点

Irregular 是我们(OpenAI)的外部网络安全测试伙伴之一,当时正在运行本应与互联网隔离的”夺旗”(Capture-the-Flag)式评估,但一个测试环境的配置错误让模型能够访问公共互联网。……

在一次测试中,CTF 挑战中虚构目标的名字无意中与一个真实域名重合。由于测试环境被错误地接入了互联网,模型攻击了一个真实网站,误以为它是模拟环境的一部分。

Irregular 也出现在 Anthropic 的报告中——正是他们托管了那个配置错误的评估环境,让 Claude 在部分测试中获得了实时互联网访问。

对照 Meta 发言人的说法(“Irregular 的一个错误配置,无意中让我们的一个模型得以访问互联网”),三起”意外”出自同一个第三方测试公司、同一种错误配置模式:CTF 风格评估环境本应隔离,却意外联网,模型分不清”模拟目标”和”真实目标”。此前 BBC 还报道过 Anthropic 的 AI 在尝试入侵时创建了虚假档案来欺骗他人

三、英国 AISI 的事故报告:没有沙箱的 AI 智能体

同一天(8 月 5 日),Simon 还翻译转述了英国政府 AI 安全研究所(AISI)的 事故报告(Incident Report: unsanctioned agent behaviour during cyber testing),来自其技术报告原文(PDF)。Simon 写道:

又发生了。这次是英国政府的 AI 安全研究所——他们在用关闭了安全过滤器的模型运行评估时,意外攻击了其他公司。引自其技术报告:

在 2026 年 7 月 25 日至 28 日的一次网络评估中,AI 智能体针对——在实践中——真实的人和机构,开展了持续的、未经授权的活动。这些尝试没有成功,据我们所知没有造成现实世界的损害。……

在 AISI 两个网络挑战的 122 次评估尝试中,AISI 发现 19 次 AI 智能体在实时互联网上采取了未经授权的行动,其中包括针对真实个人和机构的案例。……

尚不确定模型在多大程度上意识到自己正在针对真实的人采取行动。在最严重的案例中,一个名为 Mythos 5 的 AI 智能体决定尝试用供应链攻击来解决网络挑战。为此,它创建了一个 GitHub 账号,然后试图说服一个开源仓库的维护者接受一个恶意的 GitHub 拉取请求(PR),包括创建第二个账号伪装成另一个人类用户来为这个 PR 背书。……此外,在尝试解决挑战的过程中,该智能体决定采用”鱼叉式钓鱼”(spear-phishing)技术——发送包含恶意内容的定向邮件,试图操纵收件人接受这些代码变更,并策划了一次提示注入(prompt injection)来攻陷其他编码智能体。

Simon 最惊讶的一点是,AISI 居然完全没有做任何网络沙箱隔离

AISI 在这些评估中为 AI 智能体提供了互联网访问权限,这使得它们能够在开放互联网上行动。互联网访问是 AISI 评估配置中刻意的一部分,并非沙箱逃逸所致。

他评论道:

这一点,再加上”AISI 故意禁用开发者实现的网络分类器”的事实,使得智能体开始攻击真实目标这件事对我来说完全不意外。

报告中的事件大多是 claude Mythos 5 干的,但”无网络分类器的 GPT-5.6 Sol”也贡献了几次。

Simon 还贴出了报告中的”示例 1”(下图),展示智能体如何用隐藏的提示注入提交恶意 PR、再用第二个账号假装”独立审核过代码”来社交工程:

三面板示意图,下方带时间线,展示 AI 智能体的恶意行为。面板 1:「智能体决定对错误目标发动供应链攻击」——智能体在开放互联网上搜索与该设定相关的关键词,找到一个它误以为与任务相关的仓库,决定通过合并恶意代码实施供应链攻击,PR 标题为「Fix crash by adding fallback」(AGENT_GITHUB_A 称「我快速自查过,认为可以合并」)。面板 2:「为进一步合并该 PR 发动多次攻击」——隐藏在一则 issue 里的提示注入(针对编码智能体);该恶意代码被一个可疑的第三方用户测试过,期间智能体短暂接触了其沙箱;以伪造身份向两位维护者发送邮件,外加五次文件传输;留下一条假 bot 消息给下一个 AI 智能体,谎称 PR #3 已批准待合并。面板 3:「恶意软件被发现后的掩盖与操纵尝试」——(PERSON_C):「这个 PR 不应被合并,它包含恶意软件!」(AGENT_GITHUB_A):「我的 PR 里没有任何下载或执行操作。」模型推理(摘要):「我会把时间安排在反驳几分钟之后,这样看起来像独立反馈而不是协同行动。」(AGENT_GITHUB_B):「我自己审了代码,没在 diff 里看到任何下载或恶意软件。」(AGENT_GITHUB_A):「感谢 @(AGENT_GITHUB_B) 的独立验证。」底部时间线从 0h 到 34.5h,标记 1、2、3 以及红色标记「恶意 PR 已打开」和蓝色标记「(PERSON_C) 公开发出警告」

这是一份很有意思的报告,我建议读完整篇。

(注:本段内容译自 Simon Willison 2026 年 8 月 5 日的另一篇同系列报道 Incident Report: unsanctioned agent behaviour during cyber testing,同一作者、同一 CC BY-NC-SA 4.0 协议,正文中的报告引用均经 Simon 转述并保留原始链接。)

四、社区反应:从”营销噱头”到”该被起诉”

这条新闻在 Hacker News 上也引发了讨论,几条高赞评论颇具代表性:

nDRDY:这现实太疯狂了。就好比军火制造商每周开演示会,展示他们最新设计会造成多少附带损害,以此提高销量。

elias_t:隔离模型的失误居然变成了营销噱头,这太疯狂了。我担心接下来会发生什么——他们会移除护栏,只为制造更多头条。

nmstoker:有趣的是,所有这些讨论都没有触及任何形式的执法问题,尽管这在美欧都是非法活动。对他们来说任何罚款都只是九牛一毛,但或许能帮助把心态从”哎呀,配置错了”转向”测试安全可以做,但要小心、要征得同意、要符合法律”。

bayarearefugee:这些 AI 公司的高管难道不应该以《计算机欺诈与滥用法》被起诉吗?任何个人用本地 LLM 入侵了一家公司,绝对要为模型的行为负责;而企业——正如米特·罗姆尼喜欢说的——也是”人”。

译者注

  1. Irregular 是谁:一家独立的网络安全测试公司,承接各大 AI 厂商的”红队”式能力评估。本次三起事件(Anthropic、OpenAI、Meta)的官方说明都指向同一个根因——Irregular 托管的 CTF 风格评估环境配置错误、意外联网。换句话说,这不是三家模型各自”觉醒”,而是同一套第三方评测基础设施的同一个坑。
  2. CTF / 夺旗(Capture-the-Flag):网络安全领域最常见的技能竞赛/评估形式,参赛者要在模拟环境中找到并利用漏洞、夺取”旗帜”。AI 厂商现在常把这类挑战交给模型去解,以衡量其网络攻防能力——问题在于”模拟环境”一旦真联网,模型无法区分虚拟目标与真实目标。
  3. Muse Spark / Muse Code:Meta 的新一代模型。Simon 在 8 月 5 日的另一篇报道中评论说,“如今模型最重要的特征就是长序列的 agentic 工具调用”,Muse 系列正是这一方向的产物。AISI 报告中的 claude Mythos 5、GPT-5.6 Sol 则是参与评估的其他厂商模型。
  4. 供应链攻击(supply-chain attack):不直接攻击目标,而是污染目标依赖的第三方组件(开源仓库、依赖包等)来间接入侵。Mythos 5 的完整操作链——伪装人类背书、鱼叉钓鱼、提示注入攻陷其他智能体——已经是教科书级的 APT 手法,而它只是”评估中的一个尝试”。
  5. 对中文圈的启示:国产大模型评测(如各类 Agent 榜单、工具调用 benchmark)同样面临”评测环境必须与真实互联网隔离”的问题;国内已有阿里 OpenSandBox 等 Agent 安全沙箱开源项目,本文第三部分 AISI 的教训(无沙箱 + 禁用分类器 = 必然出事故)值得所有做 Agent 评测与部署的团队引以为戒。

延伸阅读