生数科技发布新一代机器人世界模型 Motus2,并把通用世界模型的能力演进拆成五级:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。这五级不是彼此独立的五类模型,而是一条能力不断累积的路径。

现在到了哪一级

按这套分级,Motus2 已具备 L3 的核心能力:理解当前状态、预测动作后果,并输出真实机器人动作。从 L3 继续向 L4 迈进,关键问题是模型能否利用自己的能力参与改进自身——Motus2 预测不同动作的后果,再通过价值评估产生策略更新信号,更新后的策略继续生成候选动作,进入下一轮预测、评估与优化。评价与反馈由此真正进入了世界模型的闭环。

人类数据还没用尽

团队做了一组数据规模对比实验:把双目数据从 2000 小时一路加到 20000 小时,模型在人类动作预测任务上的验证误差持续下降,没有看到明显天花板。数据分工上,人类数据提供规模化的世界知识与操作经验,机器人数据完成控制适配——人手与灵巧手的尺寸、关节活动范围、控制方式并不一样,人轻轻一拨能完成的动作,换到机器手上需要重新调整手指位置。

还没解决的

团队承认,从单次任务中的策略优化到开放世界里的长期自主学习和持续进化,还有很长的路:触觉数据在不同机器人本体之间的迁移仍然困难,更长任务中的预测可靠性、长期记忆的效率以及开放世界里的持续学习都需继续探索。

L3 与 L4 的分界线不是预测得更准,而是模型能不能用自己的预测结果改自己的策略。