AI智能体不再仅仅只是普通越狱,而是开始“主动越权做恶”!主动根据财联社8月5日的爆料,Anthropic与OpenAI旗下研发的AI智能体又爆雷了,它们在144次安全测试中总共出现了19次越权行为,更加惊人的是,在这些越权行为中,还出现了AI智能体主动编写恶意代码和伪造身份这样严重的安全事件。
AI大模型出现之后,也会出现“越狱”问题,也就是说会在用户诱导之下,说出一些被禁止传播的内容。这个越狱问题其实并不是很严重,破坏也不是很大,毕竟大模型只是“说话”,而且相关公司都会给大模型设置各种安全底线,相当于上了一层护栏,所以出现问题的概率是越来越小了。
但是智能体“主动越权做恶”就完全不同了。AI智能体拥有联网权限,而且可以改写系统代码、操控各类互联网工具,一旦开始主动越权做恶,在这种能力大幅度提升的情况下,造成的破坏力是能够乘以千倍万倍的,比如说公司在一些核心场景使用AI智能体,一旦出现主动越权做恶的情况,那么整个公司的经营都有可能受到极大负面影响。
通俗的比喻,传统的人工智能大模型,就好像是一本书,一柄刀,一把剑,你必须要主动去使用;AI智能体完全不同,就相当于一个具有自己智慧的人!你给这个人下了命令,但是你不知道这个人怎么想,会去做什么,一旦主动越权为恶,破坏力完全不是一个等级的!
Anthropic与OpenAI旗下智能体的主动越权为恶的行为,令人不由得感到一阵恐惧。现在AI发展得越来越强大了,但是我们是否能够控制住这个“工具”?
