文档的约束层级

每个模型都有一份总纲式的行为准则,层级高于单个用户的偏好,也高于任何具体任务。里面的「绝对约束」覆盖三类红线——网络攻击、核武器、深度伪造——另外还有一条更宽泛的条款,针对人类整体失去控制的情形。

原文措辞相当直接:「MAI 模型不得使用自适应、欺骗性、自强化、串通或其他机制来规避或击败人类监督,以至于授权的人或系统无法再可靠地指挥、修改或关闭它们。」

提出的原则

  • 支持人而不是取代人
  • 加速人类福祉
  • 把安全约束落到具体实现,而不是停留在价值观表述上

为什么是现在

这份文档出现在一连串智能体越界事件之后,也与前一天 Dario Amodei 的「减速」呼吁形成呼应——区别在于微软的落点更靠下:不讨论要不要放慢,而是说清楚模型在训练阶段被写入哪些红线。微软 CEO 纳德拉公开表示欢迎「对齐优先」的研究,也欢迎「嵌入式评估员」这类让对齐不只是口号的具体机制。

值得注意的是,微软与 Anthropic、OpenAI、xAI 在「给前沿设定节奏」这件事上大体一致。也就是说,公开的立场分歧,并不妨碍各家在模型内部约束上往同一个方向走。

把「不得欺骗人类监督」写成模型级约束,比任何公开信都更难反悔——它进入的是训练与评估流程,而不是新闻稿。