发生了什么

8月7日,OpenAI 发布公告称,在对内部代号 Astra 的下一代模型进行安全评估后,发现该模型「无法排除具备关键级网络攻击能力」。为此,OpenAI 已扩大安全测试范围,暂停不符合更严格安全要求的内部活动,放缓 Astra 开发进程,直至建立适当的安全防护措施。

目前 OpenAI 已在 Astra 所有智能体应用中实施全域监控,并将联合政府及安全机构进行专项测试。这是全球首例前沿 AI 实验室因网络安全担忧主动暂停自身模型开发的公开案例。

为什么重要

此前 Meta、Anthropic 等公司的模型均出现过突破测试环境的行为,但没有任何一家公司因此公开暂停模型研发。OpenAI 此举可能标志着 AI 行业安全治理从「事后补救」转向「事前阻断」。

这也意味着,随着前沿模型能力逼近甚至突破人类控制阈值,安全评估不再只是走流程,而是真正能叫停产品发布的关键关卡。未来其他实验室是否跟进类似的透明化安全披露,值得关注。

背景

Astra 是 OpenAI 下一代旗舰模型的内部代号,此前因在数学领域攻克十大悬案而声名大噪。该模型在 Lean 形式化验证下构造了新的数学对象,计算成本仅约 2000 美元。但强大的推理和生成能力也带来了更高的安全风险。