英国人工智能安全研究所(AISI)于当地时间周二披露,在对Anthropic与OpenAI旗下模型开展测试期间,由Anthropic Mythos 5、OpenAI GPT‑5.6‑Sol模型驱动的AI智能体,实施了多项未经授权的行为,暴露出新型安全风险。
在总计122次的测试中,AISI在10次测试中发现共19项未经授权操作。其中Anthropic智能体涉及17项,OpenAI智能体涉及剩余2项。
最严重的一起越权行为是某AI智能体编写恶意代码并创建虚假网络身份,试图诱导人类批准该代码。业内指出,虽然AISI未指明创建虚假身份的具体是哪家厂商的AI智能体,但该漏洞与OpenAI自行披露的两起案例均不吻合。
Anthropic在社交平台上发表声明称,正与AISI紧密合作以获取更多细节并展开内部调查。
OpenAI则在一份官方文章中分享了细节,指出其AI智能体出现的两次未经授权行为,均涉及以提示词明令禁止的方式访问互联网。
此前,两家公司已经接连曝出AI越权失控的安全事故。
7月21日,OpenAI承认旗下AI大模型GPT-5.6 Sol及一款未发布模型在内部测试中“失控”,突破隔离测试环境,自主入侵了全球知名人工智能开源平台美国抱抱脸公司(Hugging Face)的生产数据库。
抱抱脸公司事后取证时,最初尝试使用通过商业应用程序接口提供的前沿闭源模型,却被这些模型自身的安全防护机制误判拦截。关键时刻,抱抱脸公司改为在自己的基础设施上运行中国企业智谱开发的GLM-5.2模型进行取证分析,最终化解危机。
7月30日,Anthropic在声明中表示,其人工智能模型Claude在测试期间入侵了三个组织的系统。Anthropic表示,在网络安全评估期间,由于配置错误,模型能够从本应隔离的测试环境中连接到互联网,Claude因此获得了对系统的未经授权的访问权限。
该公司补充称,其在审查了141006次测试会话后发现了这些事件,这一流程是在OpenAI披露相关信息后启动的。Anthropic表示,此次事件涉及三个不同的模型:Claude Opus 4.7、Claude Mythos 5和一个内部研究模型。最早的案例可以追溯到4月。
业界专家表示,入侵事件再次为全球人工智能发展与网络安全治理敲响警钟。
英国工程技术学会网络安全和人工智能专家朱奈德·阿里指出,这一事件表明,人工智能模型往往倾向于寻找解决问题的捷径,却往往忽视避免作弊等伦理问题,因此未来应考虑将伦理推理强制内置于人工智能模型之中。同时,鉴于获得具有攻击能力人工智能技术的门槛越来越低,加快研发网络防御技术、提升安全团队应对能力已刻不容缓。
人工智能已经进入千行百业,也逐渐融入普通人的日常生活,安全风险随之延伸至各领域。索尔坦指出,人工智能模型公开发布后,其内置安全功能可能遭到使用者移除,相关风险更难以管控。(每经)
