Qwen-Drive-1.0:迈向自动驾驶视觉-语言基础模型的初步探索
Paper GitHub Hugging Face Model Scope 摘要 # 我们提出 Qwen-Drive-1.0 。这是 首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型 , 并且全程保持预训练 VLM 架构无改动 。模型以原生多模态的 Qwen3.5-4B 为基座,增加两个外部模块。BEV 感知头作为显式、可检视的 3D 探针,联合完成 3D 目标检测、语义 Occupancy 预测与 BEV 地图分割。规划专家基于流匹配生成未来自车轨迹。通过分阶段训练,我们显著提升了通用 VLM 的自动驾驶能力,并在 3D 感知、驾驶视觉问答与运动规划任务上验证了其可行性,形成了一个统一的自动驾驶视觉-语言模型,为驾驶场景适配提供了新一代 VLM 基座。 核心亮点 # 统一多任务架构。 Qwen-Drive-1.0 是首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,并且全程保持预训练 VLM 架构无改动。 外部 BEV 感知头。 作为显式、可检视的 3D 探针,联合学习 3D 检测、语义 Oc