要解决的问题很具体
机器人上跑大模型,卡在两件事:算力不够、网络不稳。把推理全放云端,机械臂一个动作等 200ms 回包,控制环直接废掉;全放端侧,几十亿参数的模型又塞不进 Jetson 这类嵌入式平台。PhyAI 的切入点是做一个统一运行时,让同一个模型的不同层自动分布在云端 GPU、边缘工作站和机器人本体上,层间通信和任务调度由运行时统一管理,应用层不用关心模型切片放在哪。
数字:MiniCPM-Robot 上的实测
- 端侧推理延迟:105.38ms → 22.64ms(约 4.7 倍)
- 整体任务加速:1.40x - 4.65x(视任务类型)
- 覆盖视觉理解、语言交互、动作规划三类典型机器人负载
- 联合机构:北邮牵头,北大、清华、明体科技、面壁智能等

为什么值得做机器人的人读一遍
市面上多数「端云协同」方案停在概念层:要么是简单的请求路由,要么只做了 KV cache 下沉。PhyAI 把三件事做成了运行时原语——模型分层放置、按负载动态迁移、断网降级到端侧继续跑。第三点在工厂和仓储场景尤其实际:网络抖动时机器人不能原地死机,必须有本地兜底。论文里的实验覆盖了真实机器人平台,不是纯仿真数字。
行业背景:端侧推理在 2026 年的坐标
面壁智能的 MiniCPM 系列一直在推端侧路线,Meta 的 Muse Glimmer 刚开源了 30B 本地 Agent 模型,各家都在赌「推理下沉」这个方向。PhyAI 的差异点是不绑定单一模型厂商——运行时原语对 MiniCPM-Robot 有效,理论上对其他分层可切的模型同样适用。对设备厂商来说,这意味着端云混合部署可以开始标准化,不用每个项目都从通信层手搓。
机器人落地卡的不是模型智力,是 50 毫秒——把延迟压进控制环,具身智能才算接上了物理世界。