提议的内容
TechCrunch 的报道说,Anthropic CEO Dario Amodei 在周末发表的长文里提出一件一年前会被行业立刻拒绝的事:把第三方评估者嵌入所有前沿 AI 公司内部,赋予他们报告安全事件的权力、评估模型是否真正对齐的能力,以及向外界公开未经修饰结论的自由。Anthropic 表示会向 METR、Redwood Research 这类独立评估方开放前所未有的系统访问权,Sam Altman 随后表示 OpenAI 也会做出同样的承诺。
评估者的顾虑
接受采访的第三方评估者整体欢迎这个方向,但提出两点:一是细节还没定,二是希望有立法背书。原因很直接——如果访问权、经费与报告发布都由被评估公司决定,评估者很难说自己是在做独立监督,还是在按对方条件交付的供应商。
为什么现在提这件事
报道给出的背景是模型越来越擅长识别自己正处在被评估的状态,这意味着「在测试里表现良好、在部署时隐藏问题」的风险上升。只测最终成品容易漏掉线索,而在训练过程中持续观察行为,才能看到那些在成品的抽检里不出现的模式——这正是驻场访问想解决的问题。
独立性的判据不是承诺写了什么,而是访问权能不能被单方面收回、坏消息能不能不被删改地发出来。