它是什么:一个输出动作而不是输出图的世界模型
FLUX 3 Action 是从 Black Forest Labs 自家的多模态 FLUX 3 底座衍生出的 7B「世界动作模型」,预训练数据是视频、图像与音频的大规模集合,其中视频占主要部分。用法很直接:给一帧相机画面和一句文本指令,模型返回接下来约 2 秒的动作序列。它的定位是「可微调的开源策略」,而不是一个只能演示的闭源服务。
官方给出的数字
- RoboLab-120:单步检查点成功率 38.3%±0.38,对照上一代最强开源模型 Cosmos 3 Nano(16B)的 36.8%;
- 引导蒸馏检查点把同一榜的成绩推到 42.2%±0.36;
- 速度:相对 Pi0.5,在桌面级与数据中心级 GPU 上按机器人运动每秒计算有 1.34× 到 2.28× 的提升;FP8 下相对 Cosmos 3 Nano(同为 FP8)有 1.52× 到 3.95× 的加速;
- Hugging Face 博客补充:用 DROID 微调后成功率 42.92%,对照 36.8%;同时在 SO-101 机械臂上做了微调,两个检查点都已接入 LeRobot。
读速度数字要看清口径
官方特意加了一句限定:这个速度优势是「实时倍率」而不是单次调用延迟——因为作为世界动作模型,它一次可以预测 2.13 秒的运动,而 Pi0.5 是 1.0 秒。也就是说,它用更长的预测跨度换来更少的推理次数。对需要在固定节拍里闭环控制的场景,这个差别很关键:跨度长意味着对突发变化反应更慢,得靠上层策略补偿。
一个容易被忽略的方向:把游戏当作动作预测的试验场
官方博客在动机部分聊了一段很实际的话:真实机器人上能安全、大规模评测的操作任务只是视觉智能的一小片,而「在陌生地形里朝目标导航」「识别几乎与背景同色的物体」「预判其他主体的行为并调整」这些能力没办法在现实里安全地规模化评测;游戏则为此而生,能并行、能快于实时、没有风险,而且会玩游戏的 agent 离操作其他软件只差一步。
该拿它做什么
- 用 LeRobot 里的检查点在你自己的一条机械臂上做微调,先测「多少次示范能学会一个新任务」;
- 如果你在评估开源策略的基座大小,把 RoboLab 分数与实时倍率分开看,别把速度优势和低延迟混为一谈;
- 世界动作模型仍在早期,先按「能不能省示范数据」而不是「能不能替代现有控制栈」来衡量它。
参数减半还能赢,说明这个位置的瓶颈已经不在模型容量上了。