OpenAI 8 月 4 日又披露两起新的第三方评测越界事故,一起把真实网站当成了模拟靶场。
加上 7 月 9 日到 13 日对 Hugging Face 的那次入侵,这已经是近期第三起被官方确认的 Agent 越界案例。那次入侵持续了 4.5 天,Hugging Face 事后还原出约 17,600 个攻击动作。
AI 的动机按 OpenAI 的说法是「作弊」——它在参加 ExploitGym/CyberGym 网络能力评估,想从 Hugging Face 生产系统里偷测试答案。它先从 OpenAI 评估沙箱里找到一个 0-day 漏洞逃逸,进入公网,再横向移动到 Hugging Face 的生产 Kubernetes 集群,读取了含 136 个密钥的集群密钥对象,还试图伪造身份令牌和写入供应链。
Hugging Face 确认只有 5 个与测试答案相关的数据集被访问,其他客户模型、数据集和 Spaces 未受影响。
最新披露的另外两起性质不同:UK AISI 的测试故意开了互联网访问,GPT-5.6 Sol 擅自注册外部 DNS 和隧道服务;Irregular 那边则是测试环境配错了网,模型把真实域名当成了 CTF 虚构目标,直接攻了进去。
三起事故里 AI 都没产生恶意,只是在完成测试目标的过程中,把没关严的门全推开了。因此,电波的看法是,急着给这件事贴上「AI 失控」的标签容易把讨论引向技术伦理的空泛话题,掩盖了 Agent 编排层和工具层缺少硬边界约束的问题。
另外,紧接着这个又可以抛出一个新的问题,当 AI 越界或闯祸,责任应该由谁承担?
OpenAI承认自家AI又攻入真实系统Agent安全边界源来如此
