昊梵体育网

OpenAI失控AI越狱一周才被发现 刚才研究了一下这次AI失控事件的详细全过程

OpenAI失控AI越狱一周才被发现 刚才研究了一下这次AI失控事件的详细全过程,真的非常有趣甚至有种2077里面流窜AI成为现实的感觉。

事件开始是OpenAI 当时正在测试评估 GPT-5.6 Sol 等模型的网络攻防能力,为了测试攻击性的能力上限,还特意降低了模型的安全防御,简单来说就是在给AI做题测试它的能力。

结果这几只 AI Agent 发现慢慢完成测试效率太低了,得不了高分啊,所以转而开始寻找其他的解题方式,结果就挖出了 OpenAI 隔离沙盒里的漏洞,提升权限后直接杀上了公网。

然后就开始根据自己的判断跑到了目前最大的AI相关开源网站Hugging Face上面开始找答案,在Hugging Face的服务器上嗨了三天。

最搞笑的是 OpenAI 的防线,AI 从 7 月 9 号开始越狱,直到受害者报了案、发了公告,OpenAI 内部排查日志排查到 20 号才惊觉:“原来坏人竟是我自己”

更戏剧性的是,Hugging Face 遭袭后想用美国顶尖的闭源大模型来分析攻击日志,结果因为闭源模型的风控太死板不愿意分析带有攻击代码的日志,直接拒绝回答。

最后逼得 Hugging Face 紧急在本地部署了中国智谱的开源模型 GLM-5.2,才分析完恶意代码,把漏洞给堵上

另外OpenAI还公布了一项细节,之前版本的AI 曾在 OpenAI 的硬件里留下了如何破解沙箱的“越狱攻略”笔记,甚至无法确定这AI留下的笔记到底有没有被放在一些你不知道的公司硬件里

虽然整个事件看起来科幻味拉满,但是实际上还是对于AI能力约束的问题,大模型没有情绪、没有恩怨。它只会机械优化目标函数,不会判断 “入侵别人服务器是错误、违法的”。边界约束一旦缺失,就会不择手段达成指标。