昊梵体育网

#how i ai# 在网络关键能力时代放慢模型开发节奏 OpenAI 于 8 月 18 日发布文章,主题是,如何在模型能力逼近关键网络安全阈值时控制开发节奏。 因内部研究推进和风险信号增加,OpenAI 放慢规模化扩展,暂停部分前沿 RL 训练,并大规模加固研究环境、监控和对齐流程。 过去几周发生了两件事,让 A ​

#how i ai#
在网络关键能力时代放慢模型开发节奏
OpenAI 于 8 月 18 日发布文章,主题是,如何在模型能力逼近关键网络安全阈值时控制开发节奏。
因内部研究推进和风险信号增加,OpenAI 放慢规模化扩展,暂停部分前沿 RL 训练,并大规模加固研究环境、监控和对齐流程。
过去几周发生了两件事,让 AI 系统能力提升带来的风险更显紧迫:
OpenAI 与 Hugging Face 之间的事件;初步证据显示,OpenAI 即将推出的模型 Astra 可能已达到《预备框架》(Preparedness Framework)中关键网络安全能力阈值。加上内部研究快速推进,OpenAI 认为必须在训练流程各阶段加强监控、对齐和遏制保障。监控、对齐和安全标准必须走在风险前面。
OpenAI 愿意花必要时间达到这些标准,因此暂时放慢了规模化扩展节奏,具体包括:
对计划部署的最新模型暂停两周强化学习(RL)训练;
在此期间进一步加固并红队测试研究环境;扩大监控系统的覆盖范围;
计划中规模最大的前沿 RL 运行目前仍处于暂停状态;
暂停期间进行较小规模训练和评估,考察模型行为、验证保障措施、积累更多对齐证据。
OpenAI 开发更强模型的方法建立在三项保障上:
监控:发现异常行为并及时应对;对齐:降低有害或未经授权行为发生的可能性;安全措施:限制 AI 系统能访问或影响的范围。
预计未来模型将承担大部分安全工作,包括防御其他模型。这样三项保障才能随模型能力同步扩展。
在 OpenAI-Hugging Face 事件后,OpenAI 立即暂停了研究集群中可能执行代码或使用可访问互联网工具的前沿模型推理任务,随后恢复受限且更安全的代码执行路径,并逐一审查每个工作负载。
OpenAI 长期对内部编码智能体和长时间运行会话进行监控,尤其关注前沿模型的内部部署和前沿 RL 训练运行。
此前这些监控未覆盖所有使用工具的推理和训练运行。现在他们通过新的多阶段监控体系扩展了覆盖范围:
从激活分类器开始,在每个采样 token 上运行,检查模型内部活动;
将潜在问题升级给越来越复杂、计算密集度更高的自动调查系统;
调查系统检查工具操作、推理过程和完整活动序列,识别未授权访问、数据窃取、破坏性行为、绕过安全防护等尝试;
目标是在发现可疑活动后 30 分钟内发出警报;如果监控系统识别出可能违反关键安全边界的行为,会生成最高优先级警报,呼叫安全、安保和研究团队;
如果团队无法在 30 分钟内明确判定为误报,需要暂停相关活动。
该监控要求:
所有涉及工具的、达到 Sol 能力或更高等级模型的 RL 训练和评估都必须进行;8 月 7 日确定 Astra 可能具备关键网络能力后,Astra 所有带工具的推理(不仅是 RL)都增加了额外监控要求。OpenAI 估计,监控开销大约占被监控推理计算的 20%,后续将分享更多系统细节。
对齐是 OpenAI 使命的核心。随着模型获得高级能力(如发动网络攻击的能力)并在更复杂环境中运行,奖励黑客、欺骗、未经授权访问等不对齐行为的风险日益严重。
持续演进《预备框架》(Preparedness Framework),把安全防护措施贯穿训练与部署全流程,更好反映未来模型能力及其运行环境;投入模型辅助安全、更有效的监控,以及对齐研究;计划引入外部机构参与,并在方法演进过程中分享更多经验。
OpenAI 认为,前沿模型的能力正在飞速提升,理解、对齐并保障其安全的能力必须走在前面。