AI呀
早报 资讯 工具 素材 学习 排行 社区
店铺 登录
前沿突破 arXiv 2026-09-28

论文:不给任何自然语料,让生成器与学习器自对弈预训练,零样本损失随算力可预测下降

arXiv 2609.30063《Self-Play Pretraining with Zero Data》(9 月 24 日提交)试的是一件更激进的事:完全不用自然语料做预训练。作者把合成数据生成写成一个在「所有可计算结构」上的搜索,灵感来自 Solomonoff 归纳:从随机初始化开始,两个模型交替学习——生成器提出程序、由一台通用图灵机解释并产出字节序列,学习器用标准交叉熵去预测这些字节;生成器则用强化学习训练,目标是产出刚好卡在学习器能力边界上的序列,形成一个自适应课程。因为双方都没见过自然数据,这构成一次干净的迁移测试。在几个自然数据集上,零样本损失随自对弈算力可预测地下降,模型还表现出上下文学习能力,并在训练中自行发现了可辨认的数学序列。

预训练自对弈合成数据论文
查看原文 / 来源 · arxiv.org ↗
AI呀 · 聚合 AI 资讯与应用