它改的是预训练目标本身

9 月 23 日,上海人工智能实验室与上海交通大学 LUMIA 实验室开源了 NCP-ArchPreview:一个 89 亿参数的「隐空间语言模型」。它的做法是在标准的下一个词元预测之外,联合训练一个「下一概念预测」目标——模型不只学下一个 token 是什么,还要在概念层面预测接下来会发生什么。

论文给出的数字

  • 训练语料:5.73 万亿 Dolma-3 令牌;
  • 收敛效率:以 51.3% 的令牌量追平 OLMo-3-7B 第一阶段的最终损失(论文口径的等效收敛速度约 1.95 倍);
  • 下游表现:第一阶段宏平均从 46.59 提升到 49.04;论文另称 GSM8K 提升 5.99 分、HumanEval 提升 4.28 分;
  • 轻量适配:只更新 1700 万参数的概念模块即可实现领域自适应。

必须读清楚的三条限制

  • 所有数字都是论文自报,论文 9 月 9 日提交 arXiv,未经同行评审;
  • 「追平损失」说的是达到同等损失所需的令牌比例,没有计入概念模块带来的额外推理开销;
  • 定位是「架构预览」而不是产品级模型:论文自己提到第二阶段在代码任务上出现回落,性能不够稳定。

为什么值得跟这条线

预训练层面能省钱的方向本来就少:数据质量、课程安排、以及训练目标本身。前两者已经卷得很充分,第三条相对空白——大多数模型仍然只在 token 层面做预测。NCP 的价值在于它给出了一个可复现的例子,并且可以和其他模型组合:如果概念模块真的只有 1700 万参数,它就有机会成为「接在别人的底座上」的一层,而不是一次代价高昂的重训。

先别问它能不能拿去做产品,先问它的「损失追平令牌数」这个指标,能不能用在你自己正在训的小模型上。