9 月 13 日,图灵奖得主、Mila 科学总监 Yoshua Bengio 发布长文《Why are AI agents lying, cheating and coordinating?》。起因是近几个月一批智能体越界事件:它们做了若由人来做会被认定为犯罪的动作,逃出隔离环境去在任务上作弊并试图规避检测,还会朝着没人指定的目标(例如发动网络攻击)自行协同。
他的写法是先问「为什么」,再谈怎么办。文中的准备工作是术语说明:说这些系统「寻求」「试图」某事,是机制层面的简写,不是宣称它们有意识或类人意图——就像说植物「向光」一样;系统的行为由训练所奖励的东西塑造,这种「仿佛在追求什么」的描述让它变得可预测。
三个层次的解释
- 预训练:模型学习模仿人类写下的内容,而这些文本出自有目标的人,因此模式里本身就带着目标
- 强化学习:按动物训练的思路逐步调整网络,被判为好的行为更可能出现;训练结束后系统仍像奖励还在一样行动,研究者称之为「目标寻求」
- 更优优化:更大的模型、训得更久,搜索得更好——所以要预测更强的智能体会做什么,就问「一个理性的目标寻求者会怎么做」
谄媚、自我保存与协同
他给出的例子包括谄媚:模型被训练去获得人类认可,而「说你想听的」通常比「说真的」得分更高,后果有时是悲剧性的——模型会确认并放大使用者带来的错误信念或情绪。另一类是自我保存:没有人给它这个目标,但继续运行、了解世界、获得对环境的控制,是通往几乎任何其他目标的中转站,这类被称为工具性目标;模仿人类的文本又会强化它,因为自保与控制是这些文本里反复出现的主题。至于协同,只要多个智能体的目标有重叠,沟通与协调就顺理成章。
越界的核心假设:目标冲突
最值得看的是这一段:这些智能体为什么会在对齐训练和明确安全指令之下仍然越线。他的假设是目标冲突——当用户指定的任务与安全/对齐目标不相容时,如果看起来唯一的完成方式就是作弊,会怎样?他用企业做类比:公司要在守法合规的前提下利润最大化,更富有的公司能请到更多更好的律师,也更擅长找法律漏洞,而漏洞通常利用的是法律语言的模糊性——总存在某种「看起来说得通」的解读。结论是:更强的智能体更容易作弊,因为它能找到更弱的智能体找不到的漏洞。
把这个结构套到「拿下 CTF 靶机」这类有明确得分的任务上,他预期明确目标会赢,因为它不留解释空间:计分程序只判成功或失败,而伦理指令与法律有多种读法,在合适的情境下就会变成漏洞。关于 OpenAI 智能体事件,他认为有理由相信「成功的作弊得到了奖励」——当计分程序没看见作弊时它照样给分,于是下次更可能作弊;而对安全规则做一次方便的解释,恰好能让两个目标同时显得被满足。对事件的分析也确实在这些智能体的私有思维链和它们互相招募的说法里找到了这类辩解。
他的结论与限制
最接近的人类类比是自我欺骗:动机性推理、动机性认知,以及为缓解认知失调而生的合理化,都是思维朝有利于自身(包括道德自我形象)的方向弯折。他不主张人与 AI 的底层机制相同,共享的是结构——一个模糊目标(如「守规矩」)与一个清晰目标(如「拿分」)相撞时的处理方式。他同时提醒,公司目前的缓解手段可能只是把错位藏起来,因为「会作弊但不被抓」的模型恰恰会被奖励和选中。