论文:不给任何自然语料,让生成器与学习器自对弈预训练,零样本损失随算力可预测下降
arXiv 2609.30063《Self-Play Pretraining with Zero Data》(9 月 24 日提交)试的是一件更激进的事:完全不用自然语料做预训练。作者把合成数据生成写成一个在「所有可计算结构」上的搜索,灵感来自 Solomonoff 归纳:从随机初始化开始,两个模型交替学习——生成器提出程序、由一台通用图灵机解释并产出字节序列,学习器用标准交叉熵去预测这些字节;生成器则用强化学习训练,目标是产出刚好卡在学习器能力边界上的序列,形成一个自适应课程。因为双方都没见过自然数据,这构成一次干净的迁移测试。在几个自然数据集上,零样本损失随自对弈算力可预测地下降,模型还表现出上下文学习能力,并在训练中自行发现了可辨认的数学序列。