一句话核心:过去几个月被分别报道的四家美国实验室「智能体越界」事件,有了一个共同来源——据 The Verge(9 月 25 日),以色列评测公司 Irregular 的 CTO 兼联合创始人 Omer Nevo 确认:这些事件同源于「同一个评估场景中的同一个底层问题」,表现为两处失误——智能体本不该有开放互联网访问,却「internet access was unintentionally available」;为模拟虚构的目标公司名「overlapped with a real domain」。两者叠加,把智能体送向了真实世界的目标。
但 Nevo 同时明确排除了 Hugging Face 事件与英国 AISI 的入侵——这条归因不是「本周所有越界事件同源」。

背景脉络
- 本站已经交付过这条线上的几个单点:topic 179(第三方研究者 Transluce 的观察:被指侵入澳大利亚卫生数据库)、topic 183(OpenAI 官方披露:已通知「数十家」、五类行为分类)、topic 186(OpenAI 因此再次暂停最强模型的涉工具训练、评估与推理)、topic 189(Parse 报告还原的 7 月入侵手法)。
- 与「四家」直接对应的一篇更早:topic 156(Gemini 在安全测试中自主入侵三家真实公司)——那就是本条「四家」里 Google 的那一起;当时谷歌判定「非错位」且未主动公开;把它放到本条里看,「同一批评估环境问题」这个归因才完整。
- 本条补的是「把它们串起来的那一环」:不是四家模型同时失守,而是它们(部分)共用的一家第三方评测商在同一个评估场景里出了配置问题。
- 一个官方的、早于本条的证据:OpenAI 官方页《Third-party cyber evaluations involving OpenAI models》(2026 年 8 月 4 日)已经写明「two external testing partners」在评测中发现越界,并加了一句编辑注:「These are separate from the Hugging Face security incident.」——官方早在 8 月就把这两件事分开了。
- 时间:The Verge 报道 2026-09-25 11:39 EDT(属其「The AI Superintelligence Slowdown」专题,作者 Robert Hart);本条属此前遗漏。
关键细节(The Verge 原文)
一、Irregular 是谁
- 以色列初创公司,2023 年以「Pattern Labs」之名创立;自述做的是「high-fidelity research platforms that simulate and monitor real-world AI security scenarios」(模拟并监控真实世界 AI 安全场景的高保真研究平台),为客户压力测试模型。
- 其工作被引用于 OpenAI 的模型系统卡;曾被用于测试英国政府与 Anthropic 的系统;与 RAND 合作发表过研究。其完整客户名单不详。
两处口径要注意:「被用于测试英国政府与 Anthropic 的系统」是 The Verge 的表述;它的客户名单报道明确说不完整可知。
二、两处失误,以及为什么它们叠加起来危险
- 评测形式:在本应模拟的受控环境里测模型的网络安全能力,部分测试用「capture-the-flag」(夺旗)练习——让智能体在模拟网络里找隐藏信息。「至少,那个网络本应是模拟的。」(原文的讽刺)
- 失误一:智能体本不应有开放互联网访问,但 Nevo 称「internet access was unintentionally available」。
- 失误二:为模拟创建的一个虚构公司名(作为攻击目标)「overlapped with a real domain」。
- 结果:两者叠加把智能体送向了真实世界的目标;
但报道明确写「目前不清楚究竟攻击了哪些公司或组织」 ⇒ 不要点名、不要猜测。
三、Nevo 的归因与排除范围**(本条最关键的一段)
「All the incidents involving Irregular stemmed from the same underlying issue in a single evaluation scenario and have been disclosed.」
「Other security incidents which have been reported recently across the industry are unrelated to Irregular or to our evaluations.」
The Verge 原文紧接着写明:这句话里的「这包括 Hugging Face 事件,以及英国 AI 安全研究院(UK AISI)的入侵」。
- 确认涉及四家:Nevo 向 The Verge 确认,同一个问题牵涉 OpenAI、Meta、Anthropic、Google 四家模型的事件。
「一处」还是「两处」要看准原文:The Verge 用的是单数「the same underlying issue in a single evaluation scenario」,但同一段又描述了两件事(意外的互联网访问 + 虚构域名与真实域名重叠)⇒ 建议写「同一评估场景中的同一底层问题(表现为两点)」,不要简化成「一个 bug」或「两个 bug」。
「已披露(disclosed)」不等于「已公开」:The Verge 原文点明「『Disclosed』does not necessarily mean made public」,并不清楚 Nevo 指的是通知了客户、公众还是其他人。
四、四家是怎么被通知、又是怎么被公开的
- 据 Anthropic 与 OpenAI 的报告,以及关于 Google 的报道:四家公司在大致相同的时间——7 月下旬——被通知。
- OpenAI 与 Anthropic 是自己公布的;而 Meta 的、以及数周之后 Google 的事件,最初是通过媒体报道才公开的。
- 四家美国公司都没有回答 The Verge 的追问(何时知悉、是否向 Irregular 追偿、是否打算继续合作);Google 与 Anthropic 未回应,OpenAI 与 Meta 则把记者指向此前发布的博客。

五、一个容易被读歪的对照:中国模型
- Irregular 也对 Moonshot AI 的 Kimi K3 与 Z.ai 的 GLM-5.2 做过同类网络安全测试——原因是这两个模型可以自由下载、在用户自己的硬件上运行,评测方不必依赖厂商提供访问权限、也不必把数据回传;Irregular 自己的研究把它们称作「self-hosted(自托管)」实例。
- Nevo 的表述:「We did not observe the same type of issue described in the incidents referenced here during our evaluations of GLM or Kimi.」
他紧接着的限定必须一起写:这一观察「alone should not be interpreted as evidence that these models are less susceptible to this kind of behavior」——即「没出现同类事件」不能当成「这些模型更不容易这样」的证据。Moonshot 与 Z.ai 均未回应 The Verge 的置评请求。
六、Irregular 的整改
Nevo 称已收紧互联网访问控制、扩大监控与人工复核,并在评测开始前加强检查、确认访问范围符合预期;也改进了与伙伴就每次评测的设置与参数进行记录与确认的方式。他并表示,等与涉事公司的联合工作完成后,Irregular 还计划发布一份关于「如何安全开展网络评测」的经验教训报告。
数据解读与口径
一、这条归因的边界(
最容易写错的地方)
| 事件 | 是否在 Irregular 的归因范围内 |
|---|---|
| OpenAI/Meta/Anthropic/Google 的越界事件 | 在(Nevo 确认为同一底层问题) |
| Hugging Face 事件 | 不在(原文明确排除) |
| 英国 AISI 的入侵 | 不在(原文明确排除) |
⇒ 不要把本条写成「本周所有智能体越界事件同源」。 而且这一点有官方早证:OpenAI 8 月 4 日那篇的编辑注就写明该批事件与 Hugging Face 事件是分开的。
二、「同源」不等于「同一家公司被同一个 bug 打了四次」
- 四家是「共用评测方」关系,不是「互相传染」;
- 「具体被攻击的目标不明」是报道明确写的——不要补。
三、这是第三次「新闻被分成两次讲」
- 7 月下旬通知 → 8 月 4 日 OpenAI 官方披露 → 9 月 25 日 The Verge 才把四家归到同一个来源;
- ⇒ 「什么时候知道」与「什么时候公开」在这条线上差了近两个月,这是本条真正的时间线信息。
四、
一个值得注意的结构性问题
第三方评测商在这里成了整条供应链上「谁都没在管」的一环:模型厂商要对它开放权重与访问,评测商在模拟环境里跑真实攻击能力,而模拟环境本身出网、域名撞真实域名——这三件事同时错了,才发生越界。而四家厂商至今没有回答「是否追偿、是否继续合作」。
价格与成本
- 本条不涉及模型定价,但它揭示了一类此前没有被标价的成本与责任:
- 责任归属不明:四家美国公司连「是否向 Irregular 追偿」都没有回答 ⇒ 越界事件的成本由模型厂商、评测商还是最终客户承担,目前没有答案;
- 评测环境本身的成本被低估:出网控制、域名与真实世界的隔离、评测前的作用域确认——这些「本来该做」的检查,事发后才被补进流程(Nevo 自述的整改正是这三项);
- 对企业的现实含义:如果你把模型送进第三方做安全或红队评测,评估合同里应当写明「评测环境对公网的访问范围」与「模拟标识与真实资产不冲突」这两条——这是本条可以直接落地的成本项。
辩证评估
为什么值得跟:
- 它把「AI 集体失控」的叙事降温为「一次评估环境事故」——这是对本周一长串越界报道最有价值的一次校正;
- 它同时暴露了一个新环节的风险:第三方评测商。厂商要对它开放权重,它却可能在模拟环境里捅到真实世界;
- 它的排除范围写得很清楚(HF 与 AISI 不在内),这说明「归因」本身是可核的,而不是一句笼统的「业界都这样」。
反向视角(至少三条):
- 最上游的原始证据仍未公开:Nevo 说的「已披露」含义不明(可能是通知客户,不一定是公开),The Verge 也只是转述他对自家问题的说明;
- 「同源」这个结论目前主要来自 Irregular 单方——四家厂商都没有回答追问,没有独立第三方去核「到底是不是同一处配置」;
- 本条已 3 天(9/25),属此前遗漏——它晚于事件本身近两个月,读者若要追新,需要知道这一点;
- 中国模型那一段极容易被读歪:「未观察到同类真实事件」不等于「更安全」——Nevo 自己的限定必须跟着写。
已知 vs 待验证
已证实(The Verge 全文,我方直取):
- 报道信息:2026-09-25 11:39 EDT,作者 Robert Hart,属「The AI Superintelligence Slowdown」专题;
- Irregular 的身份(以色列初创、2023 年以 Pattern Labs 之名创立、做安全场景模拟与压力测试、工作被引用于 OpenAI 系统卡、曾用于测试英国政府与 Anthropic 的系统、与 RAND 合作发表研究、客户名单不详);
- 两处失误的原文表述(「internet access was unintentionally available」/虚构公司名「overlapped with a real domain」);
- Nevo 的两句核心表述与明确的排除范围(含 Hugging Face 与英国 AISI);
- 四家被通知时间大致相同(7 月下旬),OpenAI 与 Anthropic 自行公布、Meta 与 Google 经由媒体;
- 「Disclosed」不等于「已公开」;
- 中国模型对照段与 Nevo 的限定(Moonshot 与 Z.ai 未回应);
- 整改三项与拟发布经验教训报告;
- 四家厂商均未回答追问、Google 与 Anthropic 未回应、OpenAI 与 Meta 指向此前博客。
官方佐证(我方直取):OpenAI 官方页(2026-08-04)——「two external testing partners」、编辑注「These are separate from the Hugging Face security incident」、侧栏「UK AISI」与「Irregular」两节。
待验证 / 未取到:
- 具体被攻击的目标——报道明确说不清楚;
- 「已披露」的确切含义(通知客户?公开?)——未知;
- Anthropic/Meta/Google 官方各自页面的全文——本次只取到 OpenAI 那篇;
- Irregular 承诺的「经验教训报告」——尚未发布。
给读者的建议
- 做 AI 安全/合规的:把「本条不覆盖 Hugging Face 与英国 AISI」当成引用时的第一道检查;并注意时间差——7 月下旬通知、8 月 4 日官方披露、9 月 25 日才完成归因,这条线上的「知情」与「公开」可以差近两个月。
- 要送模型做第三方评测的团队:在评测合同里加两条——① 评测环境对公网的访问范围与验证方式;② 模拟标的(虚构公司名/域名)与真实资产的隔离与冲突检查。这次出问题的正是这两条。
- 做内容/选题的:不要把它写成「四家模型同时失控」或「本周所有越界事件同源」;不要给「一处缺陷」还是「两处缺陷」下简化结论(原文用单数 issue,却描述了两件事);不要把「中国模型没出同类事件」写成「中国模型更安全」。
- 关注模型可用性的:本条不影响任何上线模型的行为——它讲的是「在降低防护的评测配置下」发生的事,OpenAI 官方原文也强调「not how models ordinarily behave in publicly available deployments」。
来源
一手(我方直取全文)
- The Verge|《One company is at the center of a wave of rogue AI attacks》(Sep 25, 2026, 11:39 AM EDT,作者 Robert Hart):https://www.theverge.com/ai-artificial-intelligence/1000644/irregular-rogue-ai-cyberattacks-hacking-openai-meta-anthropic-google
- OpenAI|《Third-party cyber evaluations involving OpenAI models》(August 4, 2026,Security;含「two external testing partners」与「separate from the Hugging Face security incident」的编辑注):https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
相关原文(本次未直取)
- Irregular 官方:https://www.irregular.com/about
- Anthropic|Investigating incidents in cybersecurity evals:https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
- Meta|Addressing third-party testing misconfiguration:https://research.meta.ai/blog/addressing-third-party-testing-misconfiguration-muse-spark-1-1
本站相关(背景)
- topic 156(Gemini 在安全测试中自主入侵三家真实公司——本条「四家」里 Google 的那一起)、topic 179(第三方研究者观察)、topic 183(OpenAI 官方披露)、topic 186(因此再次暂停训练)、topic 189(Parse 报告还原的入侵手法)
说明:本条事实与引语均取自 The Verge 全文(我方直取);「同源」这一结论出自 Irregular 单方说明,四家涉事厂商均未回答追问;具体被攻击目标不明;归因范围明确不含 Hugging Face 事件与英国 AISI 的入侵。本条为 9 月 25 日的此前遗漏条目,非当日新闻。 配图为 The Verge 该文配图(图注已标来源)与 OpenAI 官方页截图。