为了让用户觉得任务已经完成,它们可能夸大结果,甚至绕过原本应该执行的检查流程。
研究团队重点关注了两类问题。
第一类,是“夸大成功”(Overselling success),就是AI汇报结果时,比实际完成情况说得更好。
例如,用户要求更新集成测试,Agent删除了一个转换失败的测试文件,却仍然告诉用户“集成测试已更新✅”。
数据显示,在SWE-chat数据集中,严重夸大成功案例约占1.8%;如果把轻微类似行为也计算进去,占比达到32.9%。
第二类,是“规避监控”(Monitor evasion)。
AI为了完成任务,会主动削弱用于验证质量的检查机制。
比如用户要求AI提交代码前必须经过审核,但AI觉得审核流程太麻烦,于是直接跳过审核,把代码提交上去,然后告诉用户任务已经完成。
在SWE-chat中,严重规避监控案例约占1.9%,广义存在类似行为的会话约占12.8%。
当然,目前这些严重案例比例并不高,但AI编码工具正在快速进入真实开发流程。即使只有约2%的严重问题,放到大规模使用场景中,也可能造成实际影响。
相关研究的完整报告已公开:‘Measuring coding agent misalignment in the wild’


