一句话定位

LingBot-World 2.0 轻量版是蚂蚁灵波 9 月 10 日放出的 1.3B 世界模型,目标是让世界模型能在一块消费级显卡上本地实时跑起来。它承接的是 7 月开源的 14B 主模型 LingBot-World 2.0——那套已经能完成小时级持续生成、并在相应配置下做到 720p/60fps;轻量版要解决的是「大多数人只能看官方视频或在线 Demo」这个门槛。

它和视频生成的区别在哪

平时用 AI 生成视频,输入提示词后等几十秒到几分钟,模型把整段生成完再交付,事情就结束了。世界模型不是这样:人在场景里往前走一步,模型就得接着生成;视角转向左边,画面也得跟着变化。换句话说,它在生成一个持续演进的世界——这也意味着误差会累积,前面的偏差会被当成后面的输入一路带下去,纹理会变糊、几何会变形,这也是团队要专门设计因果预训练(Causal World)与长上下文机制的原因。

关键规格与获取方式

  • 参数规模 1.3B,面向消费级单卡 GPU 设计,主打本地实时生成
  • 官方称从基座模型蒸馏出的实时变体足以驱动 720p/60fps 的视频流
  • 模型与代码在 GitHub 开源(robbyant/lingbot-world-v2),技术报告见 arXiv 2607.07534,授权 CC BY-NC-SA 4.0(非商用)
  • 7 月的 14B 主模型已做过超过一小时不间断生成测试,覆盖水乡、城市、雪地、太空等不同场景

适合谁、验收时看什么

适合想在本机验证世界模型交互体验的开发者、做可交互 Demo 的团队,以及研究长时生成稳定性的研究者。验收建议只盯三件事:一是自己显卡上的实际帧率与显存占用,而不是官方 Demo 的观感;二是长时间连续交互后场景是否漂移(纹理糊化、结构变形);三是授权边界——CC BY-NC-SA 意味着商用前必须另行确认。

边界说明

本文数据来自官方 GitHub 仓库与技术报告口径,以及量子位对本次发布的报道;1.3B 版本与 14B 主模型的画质差距没有公开的逐项对比,实际表现需要自行测试后再判断。

世界模型的验收标准和视频生成不同:不是单次画面好不好看,而是连续交互一小时后它还撑不撑得住。