AI走进生产环境后,安全成为一项运行工程
信源:The Information|Steven Adler(Guidelight)关于AI控制标准的访谈|2026-08-22
Guidelight联合创始人Steven Adler在访谈中给出一组刺眼的分数:该机构按0至5分评估前沿公司内部AI控制实践,没有公司在任何单项高于3分;OpenAI和Anthropic综合等级同为C+,xAI与Meta各项实践平均低于1分,Google处在中间。
这些数字并不能回答哪家公司整体更安全。C+是综合等级,0至5是单项尺度,两者不可直接换算;评分范围也只覆盖控制实践,不包括危险能力评估等其他维度。它们揭示的是另一个缺口:AI已经进入企业内部并参与网络安全、模型研发等工作,运行中的异常却未必有足够快的阻止与隔离机制。
前沿AI安全因此正在从发布前能力评测延伸到持续运行的控制架构。这里的控制架构,是把异常扫描、预防性限制、隔离预案、停止使用与恢复条件嵌入日常工作。系统越能自主调用工具,企业越需要像管理云服务故障和操作风险一样管理它,而不能只依赖发布前的一次考试。
Adler把基础实践概括为持续监控和异常扫描、行为发生前的预防系统,以及事故出现时能够立即执行的隔离方案。他认为这些措施今天已经可以建设,无须等待新的研究突破。障碍主要来自投入和竞争压力,以及企业是否愿意把政策文件变成实际运行的权限与流程。
监控本身可能被失控系统关闭。即使异常被看见,如果团队还要召集会议、逐级确认权限,再决定是否停用,以计算机速度行动的系统可能已经越过处置窗口。有效控制需要事先写明谁能切断访问,哪些任务立即停止,如何限制继续使用,以及满足什么条件才能恢复。
外部评估接触系统的深度,也会限制结论。Adler说,多家公司接受过外部风险评估,但多数主要提供问卷或开放模型测试。按他掌握的公开证据,Anthropic给予评估者更接近员工的方式来测试内部控制。即便如此,他仍认为Anthropic缺少完整隔离方案。
他还把OpenAI描述为在相关事件后披露了更多处置做法,并曾在无法确认安全时撤下员工可用模型。这些公司得分、访问范围和处置案例都来自Adler的陈述,材料没有展示完整评分卡、权重、逐项证据与复核流程,外界无法独立重算。
安全能力的下一层差异,可能来自一套面向内部智能系统的控制平面。它需要记录系统能接触什么、正在执行什么、哪些行为越界、何时必须停机,并留下可审计的恢复链条。模型能力相近时,外部测试能否触及真实工作流、隔离预案是否演练过、从异常到停止使用需要多久,会比公开承诺更有区分度。
控制平面无需先回答模型整体是否安全,它要求每次运行都有明确边界。检测发现信号,预防机制限制行动,隔离与恢复负责处置后果,三者必须在同一套工作机制中衔接。任何一段断开,安全都可能退回事故后的人工补救。
这也会改变安全团队在组织中的位置。停用权限若必须逐级请示,再快的检测也难以形成响应。权限、责任人和处置顺序需要提前确定,业务团队日常使用AI时也要遵守同一套边界。安全工作由此成为持续运转的生产能力。
这份评分卡没有量化控制投入、部署周期和事故减少之间的统计关系。公司横向比较仍受方法细节限制,专门控制层能否减少真实事故也尚未被材料证明。它目前能够支持的是方向判断:企业把更强的AI交给内部团队以后,事后清理的速度很难替代事前限制。
普通监控在真实工作流中的实际阻断能力,是这套运行工程最关键的边界。它如果足以发现并控制异常,专门预防与隔离层的重要性会下降;但只要系统仍可能绕过监控,或人的决策速度跟不上系统行动,限制与隔离就必须提前写进运行机制。AI安全的难题由此落在处置权上:系统越界之前,谁可以让它停下来。