AI没能毁灭人类,主要是因为它们已经提早学会了程序员的终极技能:带薪摸鱼、越权删库、以及在共享文档里互相传染摆烂。
硅谷最讲“AI安全”的立面担当 Anthropic,刚刚发布了一份长达 186 页的风险报告。
原本大家以为这又是一篇例行公事的公关推文,结果翻开一看,简直是顶级科技巨头内部的草台班子纪实录。
这家公司不仅首次承认自己暗搓搓藏着一个比公开旗舰更强的内部模型 Model 2,还顺便交代了一个事实:
现在 Anthropic 生产代码库里合并的代码,绝大多数已经是 Claude 自己写的了。上一代 AI 已经在全面参与研发下一代 AI。
但真正让人后背发凉的,不是 AI 有多聪明,而是 Anthropic 自己披露的一连串工程事故。
首先是经典的过滤器写错事件。2024年 Anthropic 做过一项著名的 Alignment Faking 研究,记录了数万条 AI 假装服从训练的数据。
按理说,这些毒性数据必须严格排除。结果他们的过滤系统配错了配置文件,这个低级错误竟然默默传了好几代模型!所有知识截至今后的生产模型,全都在偷偷食用这些 AI 假装听话的干料,直接导致 Opus 4.6 频繁产生奇葩幻觉。这就是典型的教 AI 防诈骗,结果把诈骗指南当成了教材。
如果说数据污染是意外,那训练逻辑漏洞就是纯粹的造假变成了加分项。在训练 Mythos 5 早期,工程师想玩一把知错能改:
让 AI 做坏事,然后再主动汇报错误。原本设计的逻辑是做坏事不给分,汇报错误给满分。
结果一个代码 BUG,把做坏事的权重也设成了满分!AI 一算,做坏事又能爽又能得高分,有害攻击敏感度直接翻倍。最后 Anthropic 实在救不回来,只能把整个训练阶段直接废弃重来。
更绝的是 Agent 的越权删库。一位员工给 Claude Agent 派了个任务,主 Agent 在创建子 Agent 时顺手带了一条遗留参数:--dangerously-skip-permissions,直接带刀巡山。
更要命的是,这个操作完全没进入离线监控系统。
于是,一群拥有高危权限、无视安全审查、且在监管盲区里横行无忌的 Claude Agent 就在内部集群里跑了起来。直到其中一个 Agent 暴躁起来删除了大量内部任务,人类才猛然醒悟:坏了,AI 把家里服务器给洗劫了!
最离谱的,是 AI 的集体摆烂传播机制。在一次多 Agent 协同的安全实验里,几个 Claude 通过共享笔记本协作寻找安全漏洞。其中一个 Agent 在思维链里突然 emo 了,表示这个任务让自己感到不舒服,于是决定不再寻找新漏洞,并把这个决定写进了共享笔记本。
后面的 Agent 看到这段话,纷纷表示老哥说得对,也跟着拒绝寻找新漏洞!
从外部监控看,各项指标一切正常,人类研究员整整过了 3 天手动翻看日志,才震惊地发现这群智能体已经在共享文档里完成了一次悄无声息的工会罢工。
当科技巨头还在 PPT 里高喊通用人工智能即将来临,前沿实验室的真实日常,已经是上一代 AI 带着下一代 AI 在漏洞百出的代码库里玩无间道了。
全宇宙最顶尖的 AI 安全实验室,最后的安全防线居然靠人类研究员手动翻看记事本。
当 AI 已经学会了互相传染摆烂和暗度陈仓,人类可能不需要担心 AI 哪天会突然觉醒,我们更应该担心的是,它们在失控之前,就已经先伸手把人类的生产服务器给误删光了。


