过去几年,多模态大模型已经能够越来越好地理解图像、视频和真实世界场景:识别物体、理解空间关系、回答视觉问题,并完成复杂的多模态推理。
但对于具身智能来说,“看懂世界”只是第一步。真正的智能体还需要进一步做到:理解任务目标,在物理世界中执行动作,并在不同机器人形态、不同环境和不同任务中保持泛化能力。
这正是 Qwen-VLA 的出发点。
Qwen-VLA 是一个通用视觉-语言-动作模型。它基于 Qwen 多模态骨干模型,将视觉感知、语言理解和空间推理能力进一步扩展到连续动作生成和轨迹预测,让模型不仅能“看”和“想”,也能开始“做”。
一个模型,覆盖多类具身任务#
传统具身智能系统往往是高度专门化的:一个模型解决桌面操作,一个模型解决导航,另一个模型适配某种机器人平台。这种方式在单点任务上有效,但很难扩展到更多任务、更多环境和更多机器人形态。
Qwen-VLA 探索的是一条更统一的路线:
能否用一个通用策略模型,同时支持机器人操作、视觉语言导航和跨机器人形态控制?
在 Qwen-VLA 中,机器人操作和视觉语言导航被统一为同一个问题:在视觉观察、语言指令和机器人形态条件下,预测下一步应该执行的动作或轨迹。模型通过 Qwen 多模态骨干模型理解视觉和语言,再通过动作解码器生成连续动作。
训练:从语言先验到闭环优化#
Qwen-VLA 的核心不只是把一个动作头接到多模态模型上,更重要的是构建了一个覆盖多任务、多环境、多机器人形态的联合训练体系。整个训练分为四个阶段,逐步从语言先验走向闭环控制。
数据#
预训练数据涵盖五大类来源:
机器人操作轨迹 是动作学习的主体,覆盖桌面操作、移动操作、双臂操作和灵巧手控制。公共数据规模超过 10,000 小时,加上超过 1,000 小时的内部真实机器人轨迹和超过 800 万条合成仿真轨迹。
人类第一视角数据 提供了开放环境中更丰富的物体、场景和手部动作先验。引入了 Ego4D、EPIC-KITCHENS、EgoDex(829 小时)、EgoVerse(1,300+ 小时、1,965 个任务、240 个场景)、Xperience 等数据集。
合成仿真数据 补足长尾场景。视觉条件合成数据覆盖 20 个桌面场景、200 个基础配置、450 个操作任务,包含 359,848 条成功轨迹;纯文本动作数据覆盖 6 类模板 × 6 种单臂机器人,生成约 720 万条轨迹、超过 14,000 小时。
视觉语言导航数据 为模型提供长程轨迹规划和指令跟随能力。
通用视觉语言数据 保留多模态理解、空间定位和指令跟随能力。此外还构建了约 48,000 条细粒度具身动作描述,从 13 个维度刻画动作过程,将自然语言与具体执行细节对齐。
四阶段训练#
核心理念:先让模型学会如何从语言生成动作结构,再学习如何根据视觉环境调整动作。
Stage I: T2A(文本到动作预训练)。 一句”拿起红色杯子”只有几个词,但对应的机器人动作是一段高维连续轨迹。Qwen-VLA 将这个过程看作一种从语言到动作的”解压缩”。在 T2A 阶段,我们冻结 VLM,不引入任何图像,只让动作解码器从语言指令和机器人形态描述中学习动作先验。
Stage II: CPT(预训练)。 解冻 VLM 和动作解码器,在完整的多模态数据上联合训练。这一阶段将 T2A 习得的语言-动作先验对齐到具体视觉场景,同时让骨干模型适应具身感知,产出 Qwen-VLA-Base。
Stage III: SFT(监督微调)。 从 CPT checkpoint 出发,分为两条路线:多任务 SFT 在操作、导航、VQA 等异构任务上联合微调;真机 SFT 在内部遥操作数据上微调,用于真实机器人部署。
Stage IV: RL(强化学习)。 从 SFT checkpoint 出发,在仿真环境中通过 PPO 直接优化闭环任务成功率,产出最终模型 Qwen-VLA-Instruct。RL 仅在 SimplerEnv 中进行,但实验表明收益可迁移到其他未见过的环境和机器人形态。
性能表现#
单一通用模型也可以接近甚至超过专项模型#
从实验结果看,Qwen-VLA 展示了通用策略模型的潜力。单一模型可以横跨 LIBERO、Simpler、RoboCasa、RoboTwin 等操作评测集,并在多个任务上接近甚至超过专项策略模型。
| 基准 | 最优专用模型 | Qwen-VLA |
|---|---|---|
| LIBERO | ABot-M0 98.6% | 97.9% |
| RoboCasa-GR1 | ABot-M0 58.3% | 56.7% |
| Simpler-WidowX | StarVLA-OFT 64.6% | 73.7% |
| RoboTwin-Easy / Hard | ABot-M0 86.0% / 85.0% | 86.1% / 87.2% |
其中,在机器人操作评测中,Qwen-VLA-Instruct 在 LIBERO 达到 97.9%,在 Simpler-WidowX 达到 73.7%,在 RoboTwin-Easy / Hard 分别达到 86.1% / 87.2%。论文中对比的很多方法是针对单个评测集分别微调的专项模型,而 Qwen-VLA 是一个统一训练的通用模型。
在视觉语言导航(VLN-CE)评测中,Qwen-VLA-Instruct 在 R2R Val-Unseen 上达到 69.0% Oracle Success Rate 和 57.5% Success Rate,在更具挑战性的 RxR Val-Unseen 上达到 59.6% SR 和 47.8% SPL,均超越现有开源基线。
在真实 ALOHA 双臂机器人实验中,经过预训练的 Qwen-VLA 在域内任务上达到 83.6% 平均成功率,在分布外泛化设置下达到 76.9% 平均成功率,大幅超过从头训练的基线(48.5% / 36.2%)和 $\pi_{0.5}$(71.6% / 41.5%)。
真实环境分布外泛化:不只是在评测集上有效#
我们同样关注 Qwen-VLA 在真实机器人上的泛化能力。
在真实 ALOHA 双臂机器人实验中,Qwen-VLA 展示了对未见过颜色、物体、背景、位置和语言指令的泛化能力。相比从头训练的策略模型,经过 Qwen-VLA 预训练后的模型在真实环境分布外设置下有明显提升。
这部分最适合通过视频展示:面对不同颜色的球,模型可以根据“抓取绿色球”“抓取蓝色球”等指令正确执行;面对训练中未见过的物体,如玩具、蔬菜、墨镜等,模型仍然能根据语言完成抓取或移动;当背景、光照和桌面布局发生变化时,模型依然能保持较稳定的执行能力;对于“整理桌面”这类组合任务,模型可以连续识别多个目标,并完成多步操作。
相比单纯展示表格,这些视频更能体现 Qwen-VLA 的核心价值:
模型不是只记住某个固定环境下的动作模板,而是在真实环境变化中理解目标并执行动作。
动态场景零样本泛化:面对移动目标也能直接执行#
除了静态桌面操作,Qwen-VLA 也在动态操控任务中展示了零样本泛化能力。
在 DOMINO 动态操控评测中,Qwen-VLA-Instruct 没有针对该评测做专项微调,但仍然达到 26.6% 成功率和 39.5 操作分,超过了一批标准 VLA 基线模型和部分动态操控专项模型。
这说明模型学到的不只是静态场景中的抓取模板,而是更可迁移的“从空间理解到运动控制”的动作先验。模型可以根据当前视觉观察、语言目标和动作生成能力,直接生成连贯的动作序列,在动态窗口中完成操作。
从多模态理解到具身智能#
Qwen-VLA 是 Qwen 多模态能力向具身智能的一次自然延伸。
过去,多模态模型主要解决“看懂世界”的问题;现在,Qwen-VLA 进一步探索如何让模型根据视觉和语言,在物理世界中生成动作。
它统一了机器人操作、视觉语言导航和跨机器人形态控制; 它将 Qwen 的视觉理解和空间推理能力连接到连续动作生成; 它通过真实机器人数据、人类第一视角数据、合成仿真数据和通用视觉语言数据的联合预训练,学习更通用的具身经验; 它也展示了通用策略模型在多类评测集、真实环境分布外泛化和动态场景零样本泛化中的潜力。
具身智能仍然处在早期阶段,真实世界长程任务、失败恢复、持续学习和更复杂的人机环境交互仍然充满挑战。但 Qwen-VLA 展示了一个清晰的下一步:
让模型不仅能理解世界,也能在世界中行动。
引用#
@article{qwenvla,
title={Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments},
author={Qwen Team},
year={2026},
eprint={2605.30280},
archivePrefix={arXiv},
primaryClass={cs.RO},
url={https://arxiv.org/abs/2605.30280},
}