量子位 9 月 13 日的报道把亮源新创过去一个多月的三项技术串在一起看。报道给出的问题清单很具体:一个机器人能跨过固定高度的障碍,不代表换一种障碍还能完成;能在一个房间里导航,不代表换场景、换本体仍然有效;正常状态下能稳定行走,也不代表受到撞击、跌倒甚至关节损伤之后还能继续工作。

LightParkour:把动作重定向的坑交给仿真重算

跑酷是全身运动里涉及复杂接触的典型任务——普通行走靠双腿与地面形成支撑,而要攀爬、撑越或跨越较高障碍时,环境本身会成为身体支撑的一部分。直接做动作重定向(Motion Retargeting)会把人类动作映射到机器人身上,容易出现手掌悬空、身体穿过障碍物,甚至整条轨迹超出机器人动力学能力。

它的做法是先恢复一段简短的动作种子,再把动作与对应障碍物一起放进物理仿真,由仿真重新建立动作、障碍物、接触力与执行器约束之间的关系;成功后提高障碍难度,并把成功轨迹作为下一轮训练的参考。于是从一段针对 45 厘米障碍的初始动作出发,可以逐步生成覆盖到 75 厘米障碍的参考轨迹——对应约 90 厘米高的 Lightbot 0 的 83% 身高。更关键的是技能切换也不再靠人工规则,系统会自己学什么时候保持行走、什么时候进入全身动作、什么时候回到普通运动。最终在机上运行的是一个统一的循环深度视觉策略:只用胸前深度相机、本体感知与速度指令,50 Hz 机载运行。

LightNav-0:导航的瓶颈是数据,不是模型

语言模型有互联网级文本数据,机器人没有天然存在的「机器人互联网」。如果导航经验全靠真机遥操作采集,每增加一个环境或一个本体都意味着新的数据成本。亮源新创用 Real2Sim2Real 数据引擎把 2,000+ 个互联网来源的真实场景转换为可复用的仿真环境,形成 4,000+ 小时视觉、语言与动作后训练经验;同一个场景可以产生不同目标、不同路线、不同视角与不同任务,摄像机几何也能随训练变化,避免模型只适应某一种固定视角。

这里有一个值得单独记下的实验结果:在当前实验范围内,扩大环境覆盖度比单纯增加相同环境里的轨迹数量,更能稳定提升泛化能力。作者据此提出,Physical AI 的数据规模化可能和大语言模型不同——不只是要更多数据,而是要在更多样的环境里积累经验。

模型结构上,LightNav-0 引入 Point CoT:先在图像空间预测目标点与可通行点,再生成后续动作 token,把推理从「视觉+语言直接出动作」改成「视觉语言理解→空间推理→动作生成」,并用 RVQ 动作编码器把连续轨迹压缩成 3 个动作 token,让视觉、语言、空间位置与机器人动作进入统一训练框架。公开的 8 项消融评测里,引入 Point CoT 后平均任务成功率提高 8.4 个百分点、SPL 提高 5.7 个百分点。在 10 个仿真设置中覆盖指令跟随、目标导航与具身视觉跟踪,真机部署时同一个模型零样本迁移到人形、四足、轮式和飞行机器人。

Light REACT:身体坏了,也得继续走

第三项针对的是异常状态:被撞、跌倒、执行器故障、关节锁死,或环境限制了原本的运动方式。这类情况单次实验里频率不高,但部署规模一大,绝对次数就上来了。Light REACT(REsilient humAnoid ConTrol)的目标不是让机器人永远保持标准步态,而是身体条件变化后尽量利用剩余的全身能力继续移动:正常走可以,跛行可以,单腿跳可以;双腿无法维持直立时,让手臂参与支撑、切换到爬行——判据始终是「在当前身体条件允许的范围内继续完成运动」。