从生成画面到生成空间
9 月 2 日,李飞飞创立的 World Labs 发布多模态世界模型 Atlas。官方称模型从头开始预训练,能把相机移动、文本、图像等多模态输入放进同一个空间上下文处理,再生成与之匹配的画面。
与常见的文生图、文生视频模型不同,Atlas 强调空间一致性:给定任意相机位置与角度,它会生成与输入内容几何相符的新视角,也能平滑扩展画面、补全输入里没拍到的部分,官方演示中包括类似“子弹时间”的多机位效果。
能干四类活
- 相机控制生成:从一张或多张图生成图像与视频,最长 1 分钟、1440p
- 空间重建:从一到数十张输入图重建真实场景,输出显式 3D,官方称超过顶级专用重建模型
- 时空模拟:对输入视频重新构图以增强戏剧效果,支持机器人真实到模拟的工作流
- 图像生成:从文本生成图像与 360 度全景,可跟随复杂提示并渲染文字
开放节奏上,部分合作伙伴已拿到抢先体验资格,早期访问会在未来几周逐步开放。对影视预演、游戏场景与具身智能来说,这种可控制的 3D 世界生成比单纯出片更接近生产力工具。
把相机交还给创作者,是世界模型从演示走向干活的关键一步。