发布信息
9 月 7 日,智象未来(HiDream.ai)正式发布具身世界模型 HiDream-O1-Embodied。按官方口径,模型基于原生全模态理念构建,打通图像、视频、3D、动作等模态,目标是让机器人具备更强的物理感知与动态预判能力;它与约一个月前发布的交互式世界模型 HiDream-O1-World(在 WBench Navi 分榜平均分 80.9 登顶)分别侧重“理解与推演”和“操作与执行”。
榜单成绩
发布同期,HiDream-O1-Embodied 首次参评具身智能仿真评测平台 RoboColiseum,在 Robustness(扰动适应)子榜以平均分 0.692 登顶。该子榜通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令做多样化改写,检验模型在非理想环境下的稳定性与泛化能力。
官方公布的技术做法
- 语言理解覆盖多元动词、句式与等价指令表达,减少对关键词匹配的依赖。
- 视觉感知综合多个视角信息,让不同视觉通道相互补充,避免单一视角失效导致任务整体失败。
- 训练阶段主动引入光照变化、画面污损、视野遮挡等非理想条件,提高执行容错。
- 与诺亦腾合作,以高精度真人动作捕捉数据为真实底座,再用生成增强对单段真实动作做变体扩增,扩充训练样本。
说明:以上内容来自智象未来发布稿,经量子位转载;厂商数据与榜单成绩可在 RoboColiseum、WBench 等公开平台复核。
具身模型拼的不再只是“看得清时做得好”,而是条件不理想时依然能完成任务。