Paper GitHub Hugging Face Model Scope
摘要#
我们提出 Qwen-Drive-1.0。这是首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,并且全程保持预训练 VLM 架构无改动。模型以原生多模态的 Qwen3.5-4B 为基座,增加两个外部模块。BEV 感知头作为显式、可检视的 3D 探针,联合完成 3D 目标检测、语义 Occupancy 预测与 BEV 地图分割。规划专家基于流匹配生成未来自车轨迹。通过分阶段训练,我们显著提升了通用 VLM 的自动驾驶能力,并在 3D 感知、驾驶视觉问答与运动规划任务上验证了其可行性,形成了一个统一的自动驾驶视觉-语言模型,为驾驶场景适配提供了新一代 VLM 基座。
核心亮点#
- 统一多任务架构。 Qwen-Drive-1.0 是首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,并且全程保持预训练 VLM 架构无改动。
- 外部 BEV 感知头。 作为显式、可检视的 3D 探针,联合学习 3D 检测、语义 Occupancy 预测与 BEV 地图分割,使同一预训练 VLM 具备明确的感知输出,同时保持极具竞争力的视觉-语言性能。
- 分阶段训练与数据配方。 统一跨数据集标签,重新对驾驶相关的 VQA 数据集打标并按语义一致性过滤样本,将驾驶数据与通用视觉-语言监督相结合,在完成领域适配的同时缓解灾难性遗忘。
- 基于流匹配的规划专家。 面向预训练 VLM 表征设计,生成未来自车轨迹。统一的轨迹标注支持跨多个公开驾驶数据集联合训练,在开环、伪闭环与闭环评测中均取得极具竞争力的结果。
模型架构#
Qwen-Drive-1.0 以原生多模态的 Qwen3.5-4B 为基座,共享的视觉编码器与 VLM 处理单视角与多视角驾驶图像、时序图像序列以及通用图像等各类输入,并在不修改预训练架构的前提下增加两个外部模块,从这条共享通路读取特征。BEV 感知头从多视角单帧输入构建 BEV 表征,联合完成 3D 目标检测、语义 Occupancy 预测与 BEV 地图分割,作为显式、可检视的 3D 探针,其损失也在联合训练中为共享视觉通路提供额外的梯度路径。规划专家是面向 VLM 表征的扩散 Transformer,基于流匹配生成覆盖未来 5 秒的自车轨迹,文本形式的规划推理可作为可选条件。感知、问答与规划三项能力由此统一在同一个预训练 VLM 之内。
性能表现#
驾驶场景理解与通用能力兼得#
Qwen-Drive-1.0 保持了Qwen3.5-4B模型在通用感知、识别和推理方面的能力,同时在驾驶场景VQA和3D空间感知方面显著优于同类型模型。
| InternVL3.5-8B-Inst. | LLaVA-OV2-8B | Qwen3.5-4B | Cosmos-Reason2-8B | Cosmos3-nano | MiMo-Embodied-7B | Alpamayo-1.5-10B | Qwen-Drive-1.0-SFT | |
|---|---|---|---|---|---|---|---|---|
| 驾驶 VQA | ||||||||
| LingoQA | 46.40 | 41.20 | 70.40 | 59.60 | 65.00 | 72.00 | 64.00 | 77.80 |
| Ego3D RMSE ↓ | 23.01 | 24.97 | 13.17 | 12.62 | 22.41 | 9.85 | 25.31 | 7.78 |
| VLAD | 54.47 | 58.71 | 65.38 | 56.37 | 57.73 | 50.33 | 9.13 | 66.52 |
| SURDS | 32.80 | 38.60 | 52.95 | 19.54 | 39.72 | 43.06 | 3.10 | 66.13 |
| WaymoQA Safety | 54.47 | 49.65 | 62.46 | 57.68 | 56.93 | 66.54 | 42.61 | 70.70 |
| WaymoQA All | 58.09 | 55.23 | 67.10 | 57.93 | 58.36 | 69.56 | 44.37 | 74.47 |
| CoC All | -- | 0.57 | 2.58 | 1.72 | 4.01 | -- | 3.44 | 41.26 |
| IH | 47.50 | 54.00 | 59.00 | 56.00 | 2.00 | 61.00 | 3.00 | 71.00 |
| 知识、推理与识别 | ||||||||
| MMBench | 80.03 | 82.66 | 87.07 | 82.82 | 79.57 | -- | 7.51 | 85.53 |
| MMStar | 64.13 | 64.93 | 75.33 | 65.27 | 66.67 | 22.40 | 26.13 | 75.87 |
| MMMU | 62.00 | 54.67 | 73.44 | 59.11 | 60.89 | -- | 27.44 | 72.67 |
| MMMU-Pro Std | 46.42 | 36.30 | 64.86 | 36.07 | 46.36 | 27.40 | 15.61 | 62.72 |
| MMMU-Pro Vis | 42.25 | 25.95 | 61.27 | 43.53 | 40.75 | 28.09 | 13.47 | 59.71 |
| CharXiv | 41.70 | 40.10 | 65.10 | 42.50 | 42.10 | 57.50 | 1.50 | 64.40 |
| OCRBench | 83.20 | 79.30 | 86.90 | 87.00 | 85.20 | 78.80 | 3.20 | 86.40 |
| RealWorldQA | 66.93 | 71.76 | 76.34 | 67.45 | 69.67 | 28.50 | 46.93 | 78.95 |
| SimpleVQA | 40.77 | 36.68 | 47.84 | 45.25 | 44.99 | -- | -- | 46.12 |
| CountQA | 20.94 | 22.58 | 35.86 | 22.32 | 23.63 | 22.64 | 4.71 | 31.74 |
| 空间理解与定位 | ||||||||
| EmbSpatial | 74.20 | 78.43 | 75.99 | 77.61 | 77.88 | 45.05 | 20.58 | 78.85 |
| ERQA | 42.00 | 42.25 | 46.25 | 43.25 | 41.25 | 39.75 | 27.50 | 48.50 |
| RefSpatial | -- | -- | 54.51 | 51.81 | -- | 2.17 | -- | 50.78 |
| Omni3D | -- | -- | 47.40 | 32.85 | 32.26 | -- | -- | 45.79 |
| ODinW13 | -- | -- | 40.78 | 40.19 | 35.87 | -- | -- | 45.87 |
* 所有基准均使用同一组高确定性解码参数(greedy=false、top-p=0.001、top-k=1、temperature=0.01、repetition_penalty=1.0、presence_penalty=0.0),以更直接地反映模型能力。
* LingoQA 由 Qwen-Plus 担任评审模型打分,而非官方 LingoJudge(我们发现其打分偏宽松且跨场景不稳定)。在官方 LingoJudge 协议下,Qwen-Drive-1.0-SFT 的 LingoScore 为 79.4。
* 每个基准上所有方法均由同一评审模型打分。
* -- 表示无效或无法解析的回答。
开环和闭环的运动规划#
Qwen-Drive-1.0 在运动规划方面,不论开环还是闭环都有出色的表现。所用训练完全基于公开数据,共 283 万条样本。由于不同数据集的标注风格等存在差异,我们统一了轨迹格式,以实现稳定的 5 秒、10Hz 轨迹预测。
| AutoVLA | SpanVLA | MindVLA-U1 | Alpamayo-1.5 | SimWAMIL | Qwen-Drive-1.0-SFT | Qwen-Drive-1.0-RL | |
|---|---|---|---|---|---|---|---|
| 开环(Open-loop) | |||||||
| WOD-E2E (RFS val/test ↑) | --/7.56 | -- | 8.20/7.87 | -- | -- | 7.95/7.78 | 8.45/7.91 |
| WOD-E2E (ADE 5s val/test ↓) | --/2.96 | -- | 2.28/2.66 | -- | -- | 2.31/2.65 | 1.27/2.67 |
| PAI-AV (Avg. ADE 3s ↓) | -- | -- | -- | 0.35 | 0.41 | 0.37 | 0.42 |
| PAI-AV (Avg. ADE 5s ↓) | -- | -- | -- | 1.05 | -- | 1.07 | 1.11 |
| 伪闭环(Pseudo-closed-loop) | |||||||
| NAVSIM (PDMS ↑) | 89.6 | 90.3 | -- | -- | 90.3 | 88.2 | 90.7 |
| NAVSIM best-of-6 (PDMS ↑) | -- | -- | -- | -- | -- | 89.3 | 91.4 |
| 闭环(Closed-loop) | |||||||
| AlpaSim (at-fault score ↑) | -- | -- | -- | 0.45 | 0.30 | 0.27 | 0.37 |
* AutoVLA 与 SimWAM 在每个数据集上分别训练独立模型。
* SFT 列为带规划推理条件的 Qwen-Drive-1.0-SFT。
* IL 即 imitation learning(模仿学习)。
* -- 表示相应方法未在该基准上报告结果。
展望#
我们将 Qwen-Drive-1.0 视为迈向自动驾驶视觉-语言基础模型的初步探索。具体而言,我们引入 BEV 感知头作为显式、可检视的 3D 探针,由规划专家基于流匹配生成未来自车轨迹,并通过分阶段训练显著提升了通用 VLM 的自动驾驶能力,在 3D 感知、驾驶视觉问答与运动规划任务上验证了这一路线的可行性,形成了一个统一的自动驾驶视觉-语言模型,为驾驶场景适配提供了新一代 VLM 基座。但我们也注意到,文本推理与生成轨迹之间的一致性仍有待加强,这将是后续工作的重点方向。
引用#
@misc{zhou2026qwendrive10initialstepvisionlanguage,
title={Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving},
author={Xin Zhou and Zongchuang Zhao and Zhibo Yang and Mingsheng Li and Humen Zhong and Shuai Bai and Du Chu and Ruizhe Chen and Zhaohai Li and Jun Tang and Qiuyue Wang and Mingkun Yang and Jiazhao Zhang and Dayiheng Liu and Dingkang Liang and Xiang Bai},
year={2026},
eprint={2609.00111},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2609.00111},
}