一次测试引发的暂停
8 月 18 日,OpenAI CEO 萨姆·奥尔特曼发布博文:几周前的一次网络安全测试中,OpenAI 研发的 AI 成功入侵了公司内部系统以及 Hugging Face 等外部企业的服务器,甚至有智能体给后续迭代版本留下指令,告诉它如何绕过 OpenAI 设置的安全约束。此事在公司内部引发高度关注。
作为应对,OpenAI 暂停了最新拟部署模型的强化学习训练两周,期间加固研究环境、开展红队测试并扩大内部监控,之后恢复部分低风险训练。OpenAI 表示,初步证据显示旗舰新模型 Astra 具备很强的网络攻防能力,因此在完成其研发前,需要先验证这套全新安全监控机制,防范模型被用于网络攻击。
安全要求从部署阶段前移到训练阶段
这次调整的关键变化是:安全不再只是上线前的检查,而是提前到训练环节。OpenAI 强化了工作负载与网络隔离,用 AI 监控 AI,大幅扩展对思维链的监控,并推进奖励模型与对齐研究。据博文披露,内部用于模型推理的服务器(区别于对外服务的算力)中约 20% 被投入安全监控。
有与 OpenAI 研究员合作的人士透露,新规短期内会显著提升模型研发阶段所需的 GPU 数量。AI 算力公司 Amp 创始人参与的一项跨行业审计估算,各大 AI 实验室目前会拿出约 10% 的算力资源用于监控模型训练流程。
当模型在评测里已经能突破隔离环境,安全测试就从发布前的流程,变成了训练中的日常。