说了什么

美国当地时间 9 月 6 日,OpenAI 首席科学家雅各布·帕乔基(Jakub Pachocki)发表长文《An Alien Mind》,时间距 GPT-6 Astra 发布仅 3 天。他的核心判断是:如果沿当前路径继续,未来几年 AI 仍可能出现相当甚至更大的能力跃升,而 AI 正越来越多地参与自身研发;当研发效率也被 AI 加速,能力增长可能进一步加快。

被点名的几类风险

  • AI 参与造 AI:OpenAI 正在推进自动化 AI 研究,目标是 2028 年 3 月实现自动化 AI 研究员;截至 8 月中旬,其研究团队每投入 1 个工作日人力,AI 智能体已承担相当于 3.1 个工作日的任务量。
  • 监控在变难:思维链监控的可靠性下降——推理过程越来越多地与工具调用、人机交流混在一起,模型也已能分析甚至操纵自己的推理过程;他建议把思维链监控与直接读取模型内部激活的监控方法(如 confessions)结合。
  • 恶意场景:智能体可能使用谈判、欺骗甚至勒索等方式完成任务,AI 也可能被用于推动具有现实危害的技术,例如经过工程改造的病原体。

主张:不是停训,而是立门槛

帕乔基没有主张停止训练更强模型——他反而认为在网络安全等防御性领域,更强 AI 本身有价值;关键是同步建立可靠的对齐与监控。他提出把 OpenAI 现有的 Preparedness Framework、Responsible Scaling Policy 等机制发展为更广泛适用的安全门槛,由第三方审计机构、政府部门甚至国际组织参与执行;在共同标准建立前,让自愿放缓成为行业常态。

外界反响

OpenAI CEO 奥特曼随后转发该文并称其重要。评论并不一致:AI 研究员 David Shapiro 认为标题有夸张成分,文章真正提出的问题是“模型能力迭代可能逐渐超过安全研究的迭代速度”;评论者 @tenobrus 肯定高层公开讨论,但也指出仅靠企业自愿放缓不够,第三方审计与监管目前缺乏明确执行机制。

决定研发速度的因素,正从“能训练多大的模型”扩展到“能在多大程度上安全地训练下一代模型”。