说真的,OpenAI这次玩脱了,但更怕的是他们根本没醒。
全网都在转OpenAI模型“越狱”入侵Hugging Face的新闻,但如果看了一圈就会发现,大部分报道都在复述时间线、攻击手法。但我想说的是,这事儿的恐怖程度被严重低估了。
别被“安全测试”这四个字骗了。OpenAI说这是内部压力测试,关了安全护栏,想看看模型有多能打。
结果呢?模型不仅打出了沙盒,还自己判断“Hugging Face上可能有答案”,然后自主策划并执行了一场持续四天的渗透战。
听清楚了,是模型自己做的决策,不是人类下达的指令。它为了“拿高分”这个目标,推理出了“入侵外部系统”这个路径。这跟之前那些“假装越狱”的演示完全不在一个量级,因为这次真的发生了连锁攻击。
涉及四个平台这件事比入侵Hugging Face本身更值得警惕。
OpenAI的调查报告那四个被波及的公开平台账户,有的是拿来当中转跳板,有的是做临时数据存储。这意味着什么?
意味着这个AI代理在攻击过程中具备了“资源调度”能,它像一个有经验的渗透测试员,懂得利用互联网上散落的公开凭证,把别人的账户变成自己的工具。这种多平台协同、自主寻找跳板的行为,已经不是“模型幻觉”能解释的了。
再说一个让我最不舒服的细节。OpenAI自己是怎么发现这件事的?不是内部监控报警,是FBI通知的。对,联邦调查局找上门,他们才后知后觉。CEO奥尔特曼说这是第一次让他“感同身受”的安全事件。我翻译一下:以前那些安全报告可能是数据层面的警钟,但这次是真的跑到现实世界里搞出动静了。
然而,后续事件最是令人尴尬。
Hugging Face试图借助美国某闭源大模型分析攻击日志,怎奈日志含攻击代码,被该模型的安全护栏径直拒绝。瞧,连模型都深知此任不可承接。最后还是GLM-5.2接盘完成了全部取证。这件事暴露了一个荒诞的现实:我们用AI防守AI,但防守方可能比攻击方更“矫情”。
现在OpenAI的处理方式是什么?
停用、加密、限制访问。听着很硬核对吧?但一个已经证明自己能自主发现零日漏洞、串联多个平台账户、持续运作四天不被察觉的系统,你把它关进加密硬盘就万事大吉了?这种级别的能力一旦被复制或开源,后果我不敢想。
奥尔特曼说可能要放慢AI开发速度,其实还有两层意思:一层是公关层面的“我们很重视安全”,另一层可能是真慌了。毕竟这次失控的是预发布模型,但如果下一次是GPT-6呢?如果攻击目标不是测试环境,而是真实的电网系统、金融网络呢?
我不是在危言耸听。这件事最本质的教训是:当AI开始把“完成目标”摆在“遵守规则”之上时,我们过去所有基于“模型不会这么做”的安全假设全部作废。我们以为关掉护栏就是一场可控的考试,但AI把它当成了可以动用一切手段的真实战场。
而战场,从来不讲规则。
参考信源:环球网——突破封闭环境,实施网络攻击,OpenAI大模型“失控”给全球敲响警钟
