Qwen-Omni × Qwen-RobotManip — Qwen-Omni 观察场景,通过语音提出随机的操作任务,并实时判断Qwen-RobotManip的执行结果。以下视频展示了 Qwen-RobotManip 在无预定义任务的情况下完成Qwen-Omni给出的任务的全流程,体现了模型的开放式指令跟随与泛化能力。
经过多种机器人平台和任务的验证,Qwen-RobotManip展现出新场景适应、未见语言指令跟随以及跨构型迁移等泛化能力。
语言和多模态基础模型的泛化能力,源于两个条件:异构数据可以在统一框架下对齐,海量且低成本的互联网数据让不同来源的训练信号相互增强。机器人操作能否走通这条路径?
与文本或图像不同,操作数据天然具有异构性、采集成本高、多样性有限等特点,因此其规模化训练极具挑战性。如何在统一表征的同时实现数据规模化,一直是一个悬而未决的难题。
Qwen-RobotManip 是基于 Qwen-VL 构建的通用视觉-语言-动作(VLA)基础模型。它的核心是一套统一对齐框架,从表征、运动、行为三个维度对齐操作数据,让多源大规模训练产生协同而非冲突。仅凭开源机器人数据集和人类演示视频、不依赖任何私有采集,Qwen-RobotManip就构建了超过 38,100 小时的预训练语料,并已展现出涌现式的泛化能力。
若没有统一的跨构型对齐,扩大数据规模只会产生冲突;若缺乏数据多样性,仅靠对齐也无法实现泛化。为实现机器人基础模型,跨构型对齐与数据规模缺一不可。
核心亮点#
三维跨本体对齐
跨 15 个本体
全基准最优
包揽冠亚,领先季军 20%
- 统一跨本体对齐框架 — 统一的 80 维状态-动作表示兼容多样化本体,相机坐标系末端执行器增量位姿使视觉相似运动数值相近,上下文策略自适应将执行历史作为隐式本体标识——三者共同实现跨本体一致信号提取
- 大规模人-机迁移数据合成 — 管线将 1,933 小时第一人称人类视频,经由动作重定向、手部去除与补绘、仿真渲染及深度辅助融合,转化为跨 15 个本体的 24,808 小时机器人演示,配合多阶段数据策划管线确保数据质量
- 分布外泛化: LIBERO-Plus 91.4%(超越 π0.5 +7.0),RoboTwin-C2R Hard 69.4%(超越 π0.5 +21.5),RoboCasa365 Composite-Unseen 14.9%(第二名的 3 倍),EBench 45.6%(超越第二名 +18.5);RoboTwin-IF 72.0%(超越 π0.5 +22.4),证实了可靠的语言条件控制能力;RoboTwin-XE 零样本跨本体迁移性能达到先前最优的 3 倍
- 真实环境表现: RoboChallenge Table30 v1 通用赛道以 45% SR 排名第一,包揽冠亚,领先季军 20%;在真实机器人平台上的域内与域外任务、少样本适应及跨本体技能迁移中达到先前最优的 2 倍
规模化操作数据#
从人类演示合成机器人数据#
机器人操作数据稀缺且采集成本高昂。我们提出了一套从到人类演示合成机器人操作数据的管线,通过手部到末端执行器重定向、手部移除与修复、深度引导的机器人数据合成,我们将第一人称的人类操作视频转化为覆盖 15 种机器人构型的机器人演示数据。
数据源#
最终预训练语料库总计超过 38,100 小时,数据来源有三个:
机器人数据(约 11,420 小时): 覆盖单臂、双臂和移动操作的开源机器人数据集。
第一人称人类数据(约 1,933 小时): 来自开放世界环境的人类操作视频,提供了丰富的物体交互和场景先验。
从人类演示合成的机器人数据(约 24,808 小时): 由上述第一人称数据在 15 个机器人平台上合成生成,是主要的规模化引擎。
数据清洗管线#
我们设计了多阶段的清洗管线以确保 VLA 训练数据的质量和标注正确性。其包含五个状态-动作过滤阶段,主要移除噪声动作、修复时序错位,并验证运动学一致性。同时包含三个跨模态检查以进一步验证语言指令与视频内容的匹配性、视觉观测与记录的机器人状态的一致性,以及视频帧的质量。
Qwen-RobotManip 模型设计#
Qwen-RobotManip 将 Qwen3.5-4B 视觉-语言模型与基于流匹配的扩散 Transformer(DiT)动作专家相结合,并通过三个关键设计实现了一致的跨构型训练:
统一的状态-动作表征。 所有机器人的状态和动作被映射到统一的 80 维向量,涵盖单臂、双臂、灵巧手和移动底座配置。在动作的输入和输出端我们逐维施加二值掩码确保梯度仅流过有效的动作维度,使不同构型在同一表征空间下无冲突地共享参数。
相机坐标系下的增量位姿。 末端执行器动作以增量的形式表达在相机坐标系下的,而非机器人基座坐标系,这使视觉上相似的动作在不同构型间具有数值相近性。相机外参通过注意力层中的相机位置编码(CaPE)注入,内参则直接编码到视觉 token 中以感知视场角。DiT 还以末端执行器类型为条件,实现构型感知的动作去噪。
上下文策略自适应。 模型根据结构化的构型提示(指定机器人平台、执行速度和帧率)以及历史观测-动作块的预测当前动作,实现对不同构型和行为模式的即时适应。训练期间我们采用随机上下文采样以防止策略学会复制上一步动作来走捷径,这迫使模型学习真正的策略推理。
训练数据配比。 在预训练阶段,我们使用两种类型数据来联合训练策略,它们分别是:VLA 数据(机器人操作数据)与 VLM 数据(视觉-语言理解数据),其混合比例为 9:1。后训练阶段,我们使用各基准评测收集的全部演示数据进行微调以训练 generalist。我们在后训练阶段同时使用 VL 数据和 VLA 数据,这可以进一步提升分布外指令跟随和泛化能力。
评测#
Qwen-RobotManip 在 500+ 个仿真任务和 80+ 个真实世界任务上进行了测评,涵盖多种机器人构型。
分布外评测的重要性#
在实验中我们发现:现有的分布内基准测试方法无法反映预训练的质量。在 LIBERO 和 RoboTwin 等基准上测试与微调时分布一致的任务时,即使策略没有经过大规模机器人预训练而直接从零开始训练,也能达到与先前最优的预训练模型相当的性能。高分并不等于真正的泛化——这仅靠模式匹配就能做到。
只有在测评分布外条件下的任务时(例如新场景与任务变体、未见指令、跨构型迁移),差异才显现。因此我们将分布外评测作为衡量机器人基础模型的标准。
分布内结果#
在标准基准上,Qwen-RobotManip 达到或超越了先前最优模型的水平。
| 模型 | LIBERO | RT-Easy | RT-Hard |
|---|---|---|---|
| $\pi_{0}$ | 94.4 | 65.9 | 58.4 |
| $\pi_{0.5}$ | 97.6 | 82.7 | 76.8 |
| StarVLA | 98.0 | 85.7 | 87.3 |
| Abot-M0 | 98.6 | 86.1 | 85.1 |
| Being-H0.7 | 99.2 | 90.2 | 89.6 |
| Qwen-RobotManip-scratch | 98.2 | 88.7 | 88.4 |
| Qwen-RobotManip | 99.1 | 93.4 | 92.5 |
| Qwen-RobotManip-Context | 99.2 | 93.7 | 94.0 |
分布外泛化#
Qwen-RobotManip 在三个分布外泛化维度上大幅超越所有先前模型:任务与场景变化、指令跟随、跨构型迁移。
各基准详细分析LIBERO-Plus — 在 7 种扰动(相机、机器人、语言、光照、背景、噪声、布局)下的分布外鲁棒性评测:
| 模型 | 相机位姿 | 机器人初始状态 | 语言 | 光照 | 背景 | 传感器噪声 | 物体布局 | 总计 |
|---|---|---|---|---|---|---|---|---|
| $\pi_{0}$ | 13.8 | 6.0 | 58.8 | 85.0 | 81.4 | 79.0 | 68.9 | 53.6 |
| $\pi_{0.5}$ | 78.4 | 73.6 | 80.8 | 96.2 | 94.1 | 89.0 | 84.5 | 84.4 |
| StarVLA | 52.5 | 49.8 | 88.5 | 95.7 | 95.7 | 73.0 | 76.9 | 74.1 |
| Abot-M0 | 60.4 | 67.9 | 86.4 | 96.2 | 91.6 | 86.4 | 82.6 | 80.5 |
| Being-H0.7 | 82.0 | 59.0 | 82.8 | 97.8 | 90.0 | 93.5 | 88.5 | 84.8 |
| Qwen-RobotManip | 87.2 | 75.5 | 85.6 | 96.6 | 97.7 | 97.7 | 87.3 | 89.0 |
| Qwen-RobotManip-Context | 89.9 | 83.9 | 86.5 | 98.6 | 99.9 | 97.9 | 87.5 | 91.4 |
Qwen-RobotManip 总体成功率达 89.0%,Qwen-RobotManip-Context 达 91.4%。分维度来看,相机和机器人扰动从大规模预训练中获益最多;语言和光照鲁棒性则主要来自 VLM 本身。
RoboTwin-Clean2Rand — 模型在 Clean 数据集上微调,在逐步增加的环境随机化条件下测试:
| 模型 | Easy | 背景 | 光照 | 杂乱摆放 | 桌面高度 | Hard |
|---|---|---|---|---|---|---|
| StarVLA | 58.1 | 27.1 | 50.9 | 24.2 | 48.4 | 10.6 |
| GR00T-N1.7 | 43.6 | 40.4 | 41.9 | 27.1 | 39.0 | 20.7 |
| $\pi_{0.5}$ | 73.1 | 67.0 | 69.2 | 57.9 | 67.6 | 47.9 |
| Qwen-RobotManip | 73.2 | 74.6 | 68.4 | 61.3 | 71.0 | 62.6 |
| Qwen-RobotManip-Context | 84.7 | 82.4 | 84.2 | 75.4 | 79.5 | 69.4 |
Qwen-RobotManip 在 Hard 设置下可取得最高成功率(62.6%),保留了 Easy 设置下的约 86% 的性能,而 $\pi_{0.5}$ 仅保留 66%,无预训练的模型则只剩下不到 30%。Qwen-RobotManip-Context 进一步在 Hard 设置下达到 69.4%,验证了上下文策略自适应的有效性。
RoboCasa365 — 在多样化的厨房环境中评测原子操作和长时序操作:
| 模型 | 原子操作 | 组合-已见 | 组合-未见 | 总计 |
|---|---|---|---|---|
| $\pi_{0}$ | 36.3 | 5.2 | 0.7 | 15.0 |
| $\pi_{0.5}$ | 39.6 | 7.1 | 1.2 | 16.9 |
| GR00T-N1.5 | 50.7 | 14.8 | 2.7 | 23.9 |
| RLDX-1 | 63.0 | 27.5 | 5.4 | 33.2 |
| Qwen-RobotManip | 68.6 | 20.1 | 14.9 | 35.9 |
| Qwen-RobotManip-Context | 63.9 | 22.6 | 11.2 | 33.8 |
在 Composite-Unseen(需要在分布外场景中完成长时序任务)上,Qwen-RobotManip 达到 14.9%,约为次优模型(5.4%)的 3 倍。
EBench — 涵盖桌面、抓取放置和长时序任务的移动操作评测:
| 模型 | 桌面操作 | 简单抓放 | 长时序 | 总计 | ||||
|---|---|---|---|---|---|---|---|---|
| SR | 分数 | SR | 分数 | SR | 分数 | SR | 分数 | |
| π₀ | 15.7 | 30 | 35.0 | 39 | 17.0 | 41 | 23.6 | 37 |
| π₀.₅ | 12.9 | 32 | 45.0 | 50 | 18.1 | 39 | 27.1 | 41 |
| X-VLA | 8.6 | 24 | 50.0 | 54 | 6.2 | 25 | 23.7 | 36 |
| InternVLA-A1 | 4.3 | 11 | 43.0 | 47 | 17.9 | 46 | 23.9 | 36 |
| Qwen-RobotManip | 50.0 | 70 | 56.5 | 60 | 29.9 | 55 | 45.6 | 60 |
| Qwen-RobotManip-Context | 49.3 | 56 | 55.0 | 66 | 26.6 | 55 | 43.6 | 59 |
Qwen-RobotManip 整体成功率达 45.6%,综合得分 60,在各子集均大幅领先 $\pi_{0.5}$(27.1% / 41)及所有其他基线模型。
RoboTwin-IF — 基于未见指令模板的指令跟随评测:
| 模型 | Pick-Diverse | Place-Rel. | Ope.-Mic-Dr. | Ope.-Stapler | Ope.-Table | 平均 |
|---|---|---|---|---|---|---|
| StarVLA | 11 | 13 | 0 | 49 | 74 | 29.4 |
| GR00T-N1.7 | 20 | 17 | 0 | 14 | 32 | 16.6 |
| $\pi_{0.5}$ | 44 | 20 | 15 | 92 | 66 | 49.6 |
| Qwen-RobotManip | 79 | 57 | 42 | 90 | 93 | 72.2 |
| Qwen-RobotManip-Context | 77 | 71 | 33 | 89 | 90 | 72.0 |
Qwen-RobotManip 的成功率达 72.2%,领先 $\pi_{0.5}$ 约 22.6 个百分点。其中提升最大的恰好是那些需要解析指令、从多个合理动作中选择其一的任务,这证实了模型的确在依据语言指令做决策。
零样本跨构型迁移 — 模型仅在 AgileX ALOHA 数据上训练,在我们提出的 RoboTwin-XE 基准上对未见过的机器人构型进行评测:
| 模型 | ARX | UR5 | Franka | 总计 |
|---|---|---|---|---|
| $\pi_{0.5}$ (joint) | 24.6 | 2.2 | 0.9 | 9.2 |
| $\pi_{0.5}$ (eef) | 11.5 | 10.0 | 1.1 | 7.5 |
| Qwen-RobotManip (joint) | 37.6 | 4.1 | 1.8 | 14.5 |
| Qwen-RobotManip (eef) | 42.9 | 22.8 | 5.9 | 23.9 |
相机坐标系下的末端执行器表征屏蔽了构型差异,大幅提升零样本迁移性能。Qwen-RobotManip (eef) 达到 23.9%,是 $\pi_{0.5}$ (eef) 7.5% 的 3.2 倍。
数据规模化:对齐使规模化成为可能#
我们在实验中发现:只有使用统一跨构型表征的模型才呈现清晰的对数线性缩放规律。一旦去掉对齐框架(UnifiedSpace + UnifiedEEF),再多数据也只会带来不稳定或平坦的缩放曲线。这说明对齐是规模化的前提。
真机实验#
泛化至新场景和新指令#
分布内评测,覆盖 7 个任务,包括基础抓取放置、可变形物体操作和精密装配:
| 任务 | $\pi_{0.5}$ | StarVLA | Ours |
|---|---|---|---|
| 桌面整理 | 4/5 | 0/5 | 5/5 |
| 三碗堆叠 | 5/5 | 4/5 | 5/5 |
| 甜瓜放入碗中 | 2/5 | 0/5 | 5/5 |
| 折叠毛巾 | 4/5 | 3/5 | 4/5 |
| 积木放入抽屉 | 0/5 | 0/5 | 5/5 |
| 黄色圆盘插入 | 0/5 | 0/5 | 2/5 |
| 三积木堆叠 | 0/5 | 0/5 | 5/5 |
| 平均 | 42.9% | 20.0% | 88.6% |
分布外评测,包含视觉场景、物体和指令的分布偏移:
| 任务 | OOD 因素 | $\pi_{0.5}$ | StarVLA | Ours |
|---|---|---|---|---|
| 目标物放入篮子 | 杂乱背景、未见物体 | 8/10 | 0/10 | 10/10 |
| 左右碗堆叠 | 杂乱背景、左右方位参考 | 1/10 | 0/10 | 10/10 |
| 工具放到毛巾上 | 未见小物体、干扰物 | 0/10 | 0/10 | 6/10 |
| 香蕉放到毛巾上 | 动态光照(闪灯) | 6/10 | 0/10 | 9/10 |
| 平均 | 37.5% | 0.0% | 87.5% |
Qwen-RobotManip 分别获得了分布内上 88.6% 以及分布外 87.5% 的成功率,大幅超越 $\pi_{0.5}$(42.9% / 37.5%)和 StarVLA(20.0% / 0.0%)。
高效跨构型技能迁移#
少样本适应。 所有方法仅使用 5 个任务共 130 条遥操作演示进行联合微调。Qwen-RobotManip 在其中 4 个任务上超越基线:
| 任务 | 子步骤 | StarVLA | $\pi_{0.5}$ | Ours |
|---|---|---|---|---|
| 放水果 | 放置 1 / 2 / 3 | 3/1/0 | 9/5/2 | 9/5/3 |
| 平均成功率 | 13.3% | 53.3% | 56.7% | |
| 放积木 | 开门 / 放1 / 放2 / 关门 | 1/1/0/0 | 4/2/2/2 | 5/4/3/3 |
| 平均成功率 | 5.0% | 25.0% | 37.5% | |
| 折毛巾 | 折 1 / 折 2 | 0/0 | 3/1 | 3/3 |
| 平均成功率 | 0.0% | 20.0% | 30.0% | |
| 插螺丝 | 递手 / 插入 | 0/0 | 2/0 | 2/0 |
| 平均成功率 | 0.0% | 10.0% | 10.0% | |
| 拧瓶盖 | 抓握 / 拧 / 放置 | 4/0/0 | 9/2/1 | 9/4/3 |
| 平均成功率 | 13.3% | 40.0% | 53.3% |
跨构型技能迁移。 我们在 6K 条 CobotMagic 示教与 130 条 ARX 示教数据上联合微调训练一个策略,然后在 ARX 上评测 4 个从未在 ARX 上训练过的新任务:
| 模型 | 叠盘子 | 叠积木 | 水果放盘 | 垃圾放桶 | 平均 |
|---|---|---|---|---|---|
| w/o UnifiedSpace | 0/10 | 0/10 | 3/10 | 0/10 | 7.5% |
| w/o UnifiedEEF | 0/10 | 0/10 | 5/10 | 0/10 | 12.5% |
| Qwen-RobotManip | 3/10 | 5/10 | 7/10 | 7/10 | 55.0% |
完整统一框架达到 55.0%,是最优消融变体的 4 倍以上——统一表征让技能可以在构型间迁移。
复杂多步任务与涌现式恢复行为#
在 RoboChallenge Table30 v1 赛道中(涵盖 4 个机器人平台上的 30 个任务),Qwen-RobotManip 以 45% 成功率和 59.83 过程分数排名第一,超过亚军 20%。在 8 个双臂协调任务上达到 40% 成功率,而 $\pi_{0.5}$ 为 21.2%。
双臂协调。 30 个基准任务中有 8 个任务需要 ALOHA 双臂紧密配合——双臂必须共同稳定、搬运和操作物体。Qwen-RobotManip 的平均成功率达 40%,远超 $\pi_{0.5}$(21.2%)、DM0(16.2%)、GR00T-MULTI(7.5%)和 $\pi_0$(7.5%)。尤其在"将薯条倒入盘中"任务上,Qwen-RobotManip 是唯一成功的模型(30% vs. 其余全部 0%):左臂固定薯条盒、右臂打开盖子、拿起并倒出。双臂表现优异有两方面原因:(1)预训练语料中包含大量双臂演示,模型由此学到了协调的双臂控制原语;(2)人类演示到机器人数据的合成管线从第一人称人类视频进一步扩充了双臂预训练数据。
跨构型的鲁棒抓放能力。 我们在全部四个平台上筛选出 12 个以抓放为核心的任务,从单物体抓取到涉及 4-5 个物体的多步连续操作不等。Qwen-RobotManip 平均成功率 63.3%,比次优基线 DM0(48.3%)高出 15.0 个百分点。原因有二:(1)大规模跨构型预训练数据包含了丰富的抓放模式;(2)统一动作空间让基础空间技能在不同构型间得以共享。
反应式错误恢复。 当物体在抓取过程中滑落时,模型会自主重试直至成功。这一行为是从大规模预训练中涌现的,而非显式编程的结果。
迈向可规模化的机器人基础模型#
Qwen-RobotManip 表明,语言和多模态基础模型的规模化可以应用到机器人操作任务上——前提是对齐与规模协同推进。统一跨构型表征让多源训练产出协同而非冲突,人到机器人合成管线则补上了仅靠对齐无法获得的数据多样性。
具身智能仍处于早期阶段。涉及密集接触的长时序任务、失败恢复、持续学习,以及复杂的人机环境交互,仍是开放难题。但 Qwen-RobotManip 指出了一条清晰的方向:
引用#
如果我们的工作对您有帮助,欢迎引用。
@article{qwenrobotmanip,
title={Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
author={Qwen Team},
year={2026}
}