它是什么

Perceptron 发布 Mk1.5,定位是控制具身 agent 的模型。相比上一代,它新增了原生音频、视频跟踪、联网检索与子代理调用能力;输入支持文本、图像、视频与音频,输出则包括文本、点、框、多边形、片段以及带时间戳的目标轨迹。API model id 为 perceptron-mk1.5。

关键设计:输出轨迹而不是逐帧检测

要在视频里跨时间跟踪同一个对象,常见做法是逐帧检测再交给下游做重识别(re-ID)。Mk1.5 直接输出带时间戳的几何轨迹,把「这是不是同一个目标」的判断放进模型内部完成,下游不需要再维护一套匹配流水线。这是它对工程链路最实际的影响:少一段容易出错、又需要调参的中间环节。

公开的数字

  • 视频分割四项基准中领先三项(Molmo2-Track、Ref-DAVIS17、ReasonVOS);在 MeViS valid_u 上由 MolmoPoint-8B 领先。
  • center-F1 0.647、point-HOTA 0.628,对比 MolmoPoint-8B(0.602 / 0.600)、Molmo2-8B(0.571 / 0.575)、Qwen3.8-27B(0.530 / 0.476)、Gemini 3.8 Flash(0.508 / 0.465)、Mk1(0.482 / 0.396)。
  • 第一人称视频上,专门训练后手部定位比其测得的最强 Gemini 模型好 50%。

以上均为厂商公布的对比数字,建议在自有数据上复核后再作为选型依据。

在哪里会先落地

这里真正的工程约束是「同一份权重无需平台特定重训即可跑在无人机、四足机器人、智能眼镜与手机上」——官方称已在其合作伙伴处部署。如果这一点成立,同一套目标跟踪逻辑就能在不同硬件上复用,硬件团队不必为每类设备各训一版。对做第一人称数据标注的团队来说,手部定位的提升同样直接,因为它是标注流水线里最耗时的一环。

把「是不是同一个目标」收进模型,省掉的往往是整条 re-ID 流水线。