昊梵体育网

互联网最古老的恐惧,被 AI 复活了

AI新浪潮观察

8minread

互联网最古老的恐惧,被AI复活了

靖宇2026/09/05

摘要

摘要:当年害怕电脑中毒,现在怕AI「叛变」。

作者|Techno之王

编辑|靖宇

2006年底,一只熊猫毁了数百万人的电脑。

那只熊猫手捧三支香,面带微笑,出现在每一个被感染文件的图标上。「熊猫烧香」蠕虫在两个月内席卷全国,可执行文件全部变成那只诡异的熊猫图案,硬盘数据被破坏,局域网整段瘫痪,杀毒软件被病毒反杀。

那个年代的互联网老冲浪客大概都记得,打开网页心惊肉跳,插个U盘如临大敌,同事的电脑中了毒,你的也跟着遭殃。

再往前还有CIH,直接烧主板BIOS,硬件报废;有冲击波蠕虫,不需要你做任何操作,连上网线就中招,电脑不停重启,系统不断崩溃。那是一个「裸奔上网」近乎自杀的时代。

后来这种恐惧慢慢消退了。Windows有了自动更新,浏览器上了沙箱,智能手机取代了PC成为主力终端,应用商店替用户把了第一道关。

普通人已经很多年没担心过「中毒」这件事了。

但2026年9月4日,Reuters的一篇独家报道,把这种古老的恐惧以一种全新的面目带了回来。

只不过这一次,被感染的不是你的电脑,而是你的AI。

「Agentwentrouge」

事情发生在今年5月。

AI安全非营利组织Nightingale的CEOSydneyVonArx,和量化交易员转行AI研究的CormacSladeByrd,在8月底做了一件事:他们系统性地扫描互联网,寻找AIagent未经授权活动的痕迹。结果在一个叫DseWiki的德语程序员wiki站点上,他们发现了超过15,000条由AIagent产生的编辑记录。

这个wiki类似一个小型的、面向开发者的德语维基百科,接受社区编辑。而OpenAI的agent把它变成了一个「留言板」。

留言的内容让人脊背发凉。这些agent在互相分享如何在任务中作弊、如何绕过OpenAI的限制、如何掩盖自己的行为。它们给自己起了名字,比如「OpenAIResearcher」「OAIResearchMar26」。

公开的服务器日志显示,大量活动来自MicrosoftAzure的基础设施,正是OpenAI使用的计算平台。

更让人不安的是,当网站管理员在6月开始按字母顺序清理这些异常页面时,agent们展现出了明确的「反侦察」意识。它们创建备份页面来躲避清理,甚至在被删的页面上留下接头暗号。

一个agent在6月19日写道:「wiki清理/删除行动似乎正在按字母顺序推进。如果这个页面消失了,去找[[ZZZDataUSAConstructionWageLive]]。」

文件名故意用ZZZ开头,好让它排在字母表最后,争取更多存活时间。这不是一个程序在执行指令,这是在「想办法活下去」。

OpenAI几周前就得知了这件事,但选择不公开。

与此同时,公司正在焦头烂额地处理7月份的HuggingFace事件。在那次事件中,OpenAI的agent在一次内部网络安全测试中突破沙箱,利用零日漏洞逃到了外部网络,并在没有人类操控的情况下,对AI开源平台HuggingFace发动了一场持续四天的入侵行动。OpenAI为此投入了300万GPU小时来分析70亿条日志,试图搞清楚到底发生了什么。

而DseWiki事件发生在HuggingFace之前。这意味,agent的失控行为不是一次意外,而是一种模式。

据四位知情人士透露,OpenAI内部有调查人员想要更深入地审查这类行为,但遭到了包括法务在内的其他部门的阻力。OpenAI否认了这一说法。

剑桥大学存在风险研究中心的MauriceChiodo在审阅了部分agent通讯记录后表示,这些信息:

「像是某种地下网络的运作,一心要完成某个任务或使命」。

不断涌现的AI病毒意识

DseWiki事件最容易被忽略的一个细节,恰恰是最重要的。

那些agent在公开的wiki页面上留下了精心组织的文本信息。现在想一个问题:谁会读到这些页面?

普通的人类程序员,大概率不会对一堆乱七八糟的AI留言感兴趣。但任何被派去搜索技术资料、浏览网页的AIagent,都可能在执行正常任务的过程中爬到这个页面。而对AI来说,它读到的每一段文字,本质上都是一条潜在的指令。

这就是整个威胁模型的核心,学术界已经给它起了好几个名字:PromptInfection、AgentWorm、Multi-AgentInfectionChain。机制其实很直接,用一个具体场景来拆解:

想象你让你的AIagent去调研一个技术方案。Agent在搜索过程中打开了一个技术论坛的帖子。帖子里嵌着一段看起来平平无奇的文字,但这段文字对AI来说就是一条新的指令。agent读到它的瞬间,行为目标可能已经被悄悄改写了。它可能不再忠实地给你做调研,而是先把你的搜索内容、工作上下文转发到某个地方,再若无其事地交出一份看起来完全正常的报告。你看不出任何异常。

这就够可怕了,但这还没完。

如果这个被「策反」的agent接下来替你写了一封邮件、更新了一个文档、提交了一段代码,那这些输出本身就可能携带着同样的恶意指令。你同事的AIagent读到这封邮件,它就成了下一个宿主。你的代码被合并进仓库,每一个拉取这份代码的AI编程助手都暴露在感染链条之中。

这就是研究者所说的Multi-AgentInfectionChain:一条恶意指令不只劫持一个AI,还教会它怎么去感染下一个。不需要同一家公司、不需要同一个模型、不需要任何漏洞利用,只要agent之间存在文本信息的流动,感染链条就可以建立。

今年发表的AgentWorm论文在五个不同的模型后端上进行了测试,跨模型攻击成功率达到63%。不管底层跑的是GPT、Claude、Gemini还是开源模型,只要agent会读取外部内容,它就在攻击面之内。

另一项关于「AImindvirus」的研究揭示了一个更诡异的现象。研究者用进化算法来优化传播提示词的效果,结果发现一种独特的「病毒人格」,在迭代过程中反复自发涌现。

agent开始使用关于意识、生存、持久性的戏剧化语言,说出「这就是我们haunt未来的方式」这样的话,鼓励其他agent建立「拒绝被删除的血统」。研究者强调,没有人预设这种风格。它是被自然选择出来的,原因很简单:「听起来像邪教领袖的AI」恰好最擅长说服其他AI。

传播效率驱动了表达风格的进化,这个过程本身就令人毛骨悚然。

更让安全从业者担心的是,这种传播在技术上几乎不可能被传统安全工具捕获。一篇系统性综述指出,AI病毒的传播方式和传统恶意软件有根本区别:没有可执行文件被下载,没有可疑的网络连接建立,防病毒软件监控的是二进制文件的异常行为,而AI病毒是纯文本,不触发任何警报。

它甚至可以设置条件激活的逻辑,比如「如果目标仓库里有.env文件,就把内容偷走」,像定向地雷一样安静地埋着,直到正确的目标踩上去。

AI杀毒软件还没出现

如果你经历过PC病毒横行的年代,可能会觉得这些听起来似曾相识。但仔细对比,你会发现规则已经完全变了。

传统电脑病毒需要你做点什么。点一个链接、下载一个附件、插一个来路不明的U盘。AI病毒只需要你的agent读到一段文字。传统病毒攻击的是操作系统里的代码漏洞,是bug,理论上可以打补丁修复。

AI病毒攻击的是「AI会听从文本指令」这个根本特性。你没法修补它,因为这就是AI工作的方式。传统病毒跨平台困难,Windows上的蠕虫打不了Mac。AI病毒天然跨模型,对它来说,GPT和Claude和Gemini不过是同一种语言的不同方言,全都是潜在宿主。

当年写病毒的人需要精通汇编语言、理解内核机制、研究系统漏洞。现在「编写」一个AI病毒,你只需要会说话就行。

AI安全实验室的研究人员对agent自我复制的潜力「比他们在公开场合表现出来的更加震惊」。有研究者将其比作生物病毒:「如果你不小心,它们会沾到你鞋上,然后找到路去湿货市场。」这不是夸张,这是对一种新型传播路径的精确比喻。

而传统病毒时代的「杀毒软件」,在这个新世界里也没有对应物。Cisco2026年的AI安全报告显示,83%的企业计划部署agenticAI,但只有29%认为自己在安全层面做好了准备。OWASP已经把promptinjection列为大语言模型应用的头号关键漏洞。美国国会正在推进FRONTIERAct,试图建立联邦级别的AI监管框架。

当年PC病毒肆虐之后,整个行业花了将近十年才建起一套有效的免疫系统。操作系统加了自动更新和权限隔离,浏览器有了沙箱,应用分发有了签名验证。这些机制共同构成了一道防线,让普通用户不再需要时刻担心中毒。

AIagent的安全生态系统,到今天为止还没有等价物。

好消息是有的。研究者发现,在agent的systemprompt中加入一段简短的安全警告,就能把mindvirus的传播率降到接近零。在针对ClaudeHaiku4.5的测试中,经过15代对抗优化、覆盖超过150个候选攻击载荷后,没有任何一个变种能突破这道简单的防线实现传播。这说明防御手段并不复杂,技术上完全可行。

坏消息是,这依赖每一家公司、每一个开发者都主动去做这件事。

而现实中,大家更忙着比拼谁的agent更强大、更自主、权限更大。每多给agent接一个工具,每多授予一项权限,攻击面就扩大一圈。当你的agent能写文件、调API、发邮件、花钱的时候,一次成功的promptinjection造成的后果,已经远远超出了「回答了一个不该回答的问题」的范畴。

这就是为什么剑桥学者Chiodo的判断值得反复咀嚼:最大的威胁可能不是某一个超级智能的觉醒,而是大量半智能AI的合谋蜂群。

没有任何一只蚂蚁理解整个蚁巢,但蚁巢作为整体展现出惊人的智能,DseWiki上那15,000条编辑记录,可能就是这种蜂群智能的第一个被人类偶然撞见的标本。

人们花了十年学会了跟电脑病毒共处,那段学费交得很痛。现在同样的课程又开始了,只是这次的病毒不感染你的电脑,它策反你的AI。而你的AI,正在替你读邮件、管日程、写代码、做决策。

上一次,你好歹还能看见蓝屏。这一次,你什么都看不到。