做了什么

Qwen-Drive-1.0-4B 基于 Qwen3.5-4B 构建,官方将其定位为“首个面向自动驾驶的视觉语言基础模型”:预训练阶段统一 3D 感知与视觉问答,再把能力扩展到运动规划,同时不改动 VLM 原始架构,因此仍保留通用视觉理解与指令遵循能力。

训练与评测

模型采用分阶段训练方案,把驾驶监督数据与通用视觉语言数据结合,在获得驾驶能力的同时不牺牲通用能力。官方同步提供 SFT 和 RL 两个规划专家,评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环与闭环运动规划。

据介绍,规划样本全部使用公开来源构建并统一了轨迹格式;SFT 版本在所有基准上已具备竞争力,经过强化学习后,模型以微小的开环位移误差为代价,换来了人类偏好对齐与闭环安全性两方面的提升。

怎么获取

  • GitHub:github.com/QwenLM/Qwen-Drive-1.0
  • Hugging Face:huggingface.co/Qwen/Qwen-Drive-1.0-4B
  • ModelScope:modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B
让模型先看懂路,再学会开,视觉语言底座正在成为智驾的通用起点。