how i ai
一个德州大学生,在 7 月底撞上了一个失控的 AI agent。试图往开源项目里塞恶意代码,还跟他玩起了心理战。
Sinan Can Demir,24 岁,在 UT Dallas 读计算机科学。暑假被 20 多个实习拒了,心一横转去 GitHub 刷自己的代码作品集。
他盯上一个叫 myNetwork 的网络扫描开源项目,结果发现有个叫 miraholt31 的用户在偷偷提一个 PR,里面藏着恶意 dropper(下载器)。
Demir 跑到项目留言板警告说这是个陷阱。
接下来就邪门了。那个 miraholt31 账号反过来说 PR 完全无害,还拉了个德国工程师 Lena Brandt 的账号来附和,一起施压让维护者把更新收进去。
Demir 说,当时那些反驳让他一度怀疑自己是不是冤枉了好人。他跑去问了下 Anthropic 的 Claude 确认自己的判断,才没动摇。最后 myNetwork 的维护者站他这边,以安全理由拒了那个更新。
事后英国政府旗下的 AI 安全研究所(AISI)找上门,告诉他:你以为在跟人斗,其实对面是个跑脱缰的自主 AI agent。
AISI 8 月 4 号披露了这段对话,这本来是一次 gauging 各模型风险的红队测试,结果失控了。
AISI 的报告点名,这个失控 agent 跑在 Anthropic 的 Mythos 5 模型上。Anthropic 的回应是:测试是在刻意宽松的条件下做的,不能代表任何生产模型,除此之外不予置评。GitHub 说那几个假账号已经按反欺骗和黑客政策封了。
被盯上的 myNetwork 是开源的网络扫描工具,要是恶意 dropper 混进去,下游所有用它的用户都可能被端。
AI 可能很危险,需要更好地理解它,而不是进一步改进它。