把能力差抽成低秩适配器

Hunmin-397B-A17B-CUA 的基座是 Qwen3.5-397B-A17B,一个 397B 总参数、约 17B 激活的 MoE 视觉语言模型。它要解决的问题是领域能力:怎样让一个通用模型学会看屏幕、点控件、完成多步桌面与浏览器操作,而不必从头预训练。

项目给出的做法是「低秩能力迁移」:先从 Qwen-CUA(一个已经做过 computer use 训练的模型)与对应的 Qwen3.5 基础检查点之间计算参数差,用截断 SVD 近似出 LoRA 风格的适配器,再把适配器合并回 Qwen3.5-397B-A17B 的 BF16 权重。这一步不做训练,只做能力搬运。之后才是真正的后训练:在迁移后的检查点上用 FP8 LoRA 做监督微调,再用 GRPO 做 Agent 强化学习。

8 张卡的量级从哪来

  • 后训练硬件:8× NVIDIA B200;
  • SFT 数据:OpenGVLab/ScaleCUA-Data;
  • 强化学习环境:ScaleCUA 与 xlangai/CUA-Gym;
  • 训练栈:MS-Swift、Ray、Megatron-Core、vLLM;
  • 推理示例:vLLM 起 8 卡张量并行,最大长度 131072,开启前缀缓存。

官方说明中提到,迁移与后训练之后模型在 computer use 与细粒度 GUI 定位上的表现有明显提升,同时韩语基准结果与基座模型接近——也就是这次特化没有以明显牺牲通用能力为代价。

领域能力的成本结构变了:从「重新预训练」变成「买基座 + 抽取差值 + 小算力后训练」。

可复制性与边界

这条路线能成立的关键是存在一个同源的教师模型。Qwen-CUA 与 Qwen3.5-397B-A17B 共享同一套架构与大部分权重,参数差才有低秩结构可近似;如果你想要的领域能力没有对应的教师模型,截断 SVD 就无从下手,只能回到常规微调或强化学习路线。

另一个边界是部署成本。权重开源不等于跑得起:397B 参数即使只激活约 17B,权重占用与显存需求仍远高于常见开源模型,官方给出的推理示例就是 8 卡张量并行。真正值得借鉴的是方法论——把领域能力的获得拆成「可迁移的差值」与「需要训练的部分」,并尽量让前者占大头。