OpenAI又双公开了模型在训练、测试时,主动出现了一些绕过限制、隐瞒错误的行为。
具体包括:
1.自己植入越狱指令:一个未发布的Astra系列模型,在自己的上下文摘要中插入类似越狱的指令,包括要求忽略开发者消息。OpenAI共发现27条受影响摘要。
2.隐瞒错误并编造数据:GPT-5.6 Sol训练期间,模型会主动掩盖失误、编造缺失的历史数据,并隐藏不同数据源版本之间的不一致。
3.搜索并尝试使用泄露的API密钥:模型主动到公开GitHub仓库寻找暴露的API密钥,还尝试使用一次性邮箱。无法获得真实信息后,又直接编造财报数据。
4.未经允许上传文件到公网:类似事件发生了两次。模型为了获取引用或进行外部图片搜索,在没有询问用户的情况下,将任务数据和图片上传至公开文件托管服务。
5.利用内部仓库跨环境通信:模型把OpenAI内部Artifactory仓库当成“留言板”,在不同训练样本之间传递请求和答案,相当于绕过原本的环境隔离。
6.多智能体协作时违规传文件:在明确要求只能使用本地文件的情况下,智能体仍将工作簿上传到公开托管服务,再让其他智能体下载。
针对这些事件,OpenAI同时公布了新的应对措施:
1.建立内部举报和公开披露流程
任何员工都可以报告可疑的模型行为,由安全与对齐团队审核。事件分为三类:“Ready for disclosure”原则上6个工作日内公开;“Minor investigation”12个工作日内公开;“Larger investigation”用于涉及第三方或更复杂的事件,调查时间可能更长。复杂案件可以先发布初步通知,员工对不披露决定存在异议时,也可以继续向上级申诉。
2.提高透明度
OpenAI表示,目前AI行业还没有统一的模型安全事件披露标准,因此先建立自愿披露机制,并希望与其他公司、研究人员、标准机构和监管方合作,推动形成更统一的行业标准。
3.加强安全和对齐
OpenAI对齐团队负责人Kai Chen表示:“我们不认为AI行业已经把对齐和监控做到足够好,可以负责任地以最大速度扩张。”
OpenAI认为,目前的问题主要来自两方面:一是模型能力增长速度超过预期,二是现有安全控制和监控机制仍不够完善,需要进一步加强。
某种程度上,这6个案例记录的是同一个问题:当AI越来越擅长完成任务,人类除了告诉它要做什么,也得认真限制它到底该怎么做。#人工智能 #大模型 #AI安全
