具身智能要求智能体能够在真实物理环境中感知、推理并采取行动,世界模型为此提供了一条可规模化的学习路径。然而,现有方法面临一个核心困境:通用视频生成模型拥有丰富的视觉先验,但对具身物理规律的建模能力不足。领域专用的具身模型则局限于特定场景,难以跨构型泛化。
Qwen-RobotWorld 以自然语言为统一动作接口,弥合了这一鸿沟。一句简单的指令——如"拿起红色杯子放到架子上"——本身就包含了完整的动作序列、目标状态与物理约束,无需任何机器人专属的控制接口。由此,操作、自动驾驶与室内导航得以在同一模型中联合训练,让不同领域的物理知识彼此增益。
语言统一动作空间:通用世界知识与具身领域知识在同一个模型内相互强化,带来跨场景、跨任务的物理泛化能力。
核心亮点#
- 语言驱动的统一动作接口 — 自然语言将 20+ 种机器人构型和 500+ 种动作类别标准化为统一接口,实现跨场景联合训练
- 双流扩散世界模型 — MMDiT 搭配 Qwen2.5-VL 作为动作编码器,融合深度语言理解与内化的物理世界知识
- 跨场景物理泛化 — 操作、驾驶、导航与人-机器人迁移在 8.6M 视频-文本对上联合训练
- 多视角几何一致性生成 — 同步 2-4 路相机流,保持 3D 一致的物体标识与运动轨迹
模型架构#
双流扩散世界模型#
Qwen-RobotWorld 采用双流多模态扩散 Transformer(MMDiT)架构:
- 理解流接收冻结 Qwen2.5-VL 编码器输出的语义特征,对应语言动作 $a_t$。
- 生成流接收视频 VAE 编码的视觉隐变量,对应视觉状态 $s_t$。
两条流在每一层通过联合注意力(Joint Attention)交互,在整个去噪过程中持续进行双向跨模态融合。
相比 T5、CLIP 等轻量编码器,选用 MLLM 作为动作编码器有两个关键优势:其一,深层语言理解能力可将复杂的组合式指令精确解析为细粒度条件信号;其二,模型内化的世界知识(例如"机械臂是具有固定连杆长度和关节约束的刚体")能隐式约束物理可行的状态转移空间,有效避免跨帧物体变形等常见问题。
Scene2Robot:人-机器人迁移#
Scene2Robot 实现了跨构型的视频编辑能力:借助多段条件机制,将人类演示迁移到 14 种机器人构型上;联合注意力使生成过程能同时参考场景外观与机器人运动轨迹。这一能力在训练阶段充当数据扩增引擎,在推理阶段则直接支持人到机器人的迁移生成。
多视角几何一致性生成#
单一相机视角不可避免地会遮挡关键的接触细节和空间信息。Qwen-RobotWorld 能够同时生成 2–4 路相机流——主视角、腕部视角与第三人称视角——并在所有视角间保持几何一致的物体标识和运动轨迹。训练时,多相机同步帧被空间拼接为一个整体输入,模型一次性生成全部视角;非对称 3D RoPE 负责空间编码,注意力层自然建立起跨视角对应关系,整个过程无需任何架构改动。这种跨视角一致性还起到了几何正则化的作用,帮助模型学习物体形状、深度关系与空间布局。
数据:具身世界知识#
EWK 数据集#
具身世界知识(EWK)数据集围绕四个互补维度构建,分别覆盖不同来源的物理变化:
- 多构型 — 人手、7 种机器人臂构型、自车、移动智能体,涵盖 20+ 种不同机器人模型
- 多任务 — 原子操作技能、长时序组合、运动、动态/形变交互,覆盖 500+ 种动作类别
- 多场景 — 真实环境优先,仿真增强:厨房、工作间、户外环境,加上用于下游 VLA 评估的高真实感仿真
- 多视角 — 主视角、腕部视角和同步多视角流(约 160 万条数据包含 2-4 视角拼接)
| 数据集 | 构型 | 视角 | 贡献 |
|---|---|---|---|
| 操作(约 590 万条) | |||
| EgoHOD, EPIC-Kitchens, Egocentric-10k | 人手 | 第一人称 | 灵巧性与协调先验 |
| Bridge V2, RH20T, Droid | 单臂夹爪 | 第三人称 + 腕部 | 交互原语 |
| Robomind, RoboCoin | 单/双臂、人形 | 第一人称 + 第三人称 | 跨构型泛化 |
| Agibot-World, Galaxea | 单臂(夹爪 + 灵巧手) | 同步第一人称 + 腕部 + 第三人称 | 时序与多视角一致性 |
| Qwen-Aloha(内部) | 双臂夹爪 | 头部 + 双腕 | 多视角抓取先验 |
| ActionNet, OpenLoong | 灵巧手 | 腕部 + 第三人称 | 精细灵巧性 |
| 自动驾驶(约 20 万条) | |||
| Waymo, NVIDIA PhysicalAI-AD, Bench2Drive, Sekai | 自车 | 环视 | 大尺度自运动与多智能体动态 |
| 室内导航(6000+ 片段) | |||
| VLNVerse | 移动智能体 | 第一人称 | 房间尺度空间推理 |
| 人-机器人迁移 | |||
| Scene2Robot(合成) | 14 种机器人构型 | 多视角 | 跨构型视频编辑 |
动作-语言映射#
构建通用世界模型的核心难题是动作表征的异质性:操作任务用关节角度,驾驶用转向指令,导航用航向向量——彼此格式不兼容,传统做法只能各建各的模型。我们提出的动作-语言映射框架将所有动作信号统一映射到自然语言空间,从而让 Franka 夹爪、自动驾驶车辆、导航智能体的视频都归结为同一个语言条件视频生成任务。
为保证标注质量与精度,我们设计了五层分级标注流水线:
训练时,两种描述以等概率随机采样,让模型既能理解详尽的轨迹描述,也能响应简短的任务级指令。
训练#
训练采用**“通用→专家"的渐进式策略**:
| 阶段 | 步骤 | 数据配比 | 目标 |
|---|---|---|---|
| 预训练 | T2I / T2V / TI2V 联合训练 | 通用数据 | 建立基础视觉先验 |
| 人类交互 | Ego4D, EPIC-Kitchen 等 | 抓取与工具使用先验 | |
| SFT | 阶段 1:单视角操作 | 具身 + 通用 联合训练 | 核心操作物理 |
| 阶段 2:多视角扩展 | 拓宽视角覆盖 | ||
| 阶段 3:多视角拼接 | 跨视角几何一致性 | ||
| 阶段 4:复杂跨域任务 | 长时序与跨场景 |
预训练阶段利用通用数据和人类交互视频(Ego4D、EPIC-Kitchen)建立广泛的视觉先验。其中 T2I 任务为物体几何形态提供了稳固的锚点,其知识通过共享骨干自然迁移至视频生成。进入 SFT 阶段后,模型沿四个阶段逐步深化具身能力,同时每个 batch 都保留通用数据参与训练,确保通用能力与具身专长同步提升、互不折损。
演示#
细粒度语言理解#
在相同初始帧条件下,仅改变指令中的一个关键词,模型即可生成完全不同的视频结果。同时,模型也能执行需要长时序推理的复杂多步指令。
对比指令跟随:
左:拿起红色草莓
右:拿起黄色土豆
左:将笔放到木质托盘上
右:将笔放到白纸上
左:递胶水给对方
右:将胶水放入笔筒
复杂多步指令:
依次拿起红色和黄色甜椒,从左到右放到桌上
抓起黄蓝堆叠块,将其放到绿蓝堆叠块的上方
跨域泛化#
(A) 跨构型:
(B) 跨任务 × 跨环境:
(C) 多视角一致性:
(D) 零样本鲁棒性:
Ours
LVP
Cosmos2.5-14B
人-机器人迁移#
Scene2Robot 机制在保留人类演示(左)原始任务意图的同时,将运动轨迹适配到不同构型各自的运动方式(右)。
超越操作:驾驶与导航#
世界模型的泛化能力不止于桌面操作,还延伸到更广阔的场景。
自动驾驶。 基于 Bench2Drive、NVIDIA PhysicalAI-AD、Sekai 和 Waymo 数据生成的驾驶片段,展现了连贯的场景动态与合理的车辆行为。
室内导航。 基于 VLNVerse 的第一人称导航片段,展示了模型在复杂室内环境中生成连贯行走视频的能力。
从桌面操作到自动驾驶,再到室内导航——Qwen-RobotWorld 证明了统一的世界模型能够突破单一构型、单一场景的局限。
性能评估#
我们与通用视频生成模型(Sora2、Veo3、Wan2.6、Kling、LTX-2)及具身世界模型(Cosmos、LVP、GigaWorld、Vidar、Wow)在四个基准上进行了全面对比。
| 类型 | 模型 | SceneC | HSD | Dyn | nDTW | Diversity | BLEU | CLIP | Logics | 总分 |
|---|---|---|---|---|---|---|---|---|---|---|
| 通用 | Veo3 | 0.842 | 0.213 | 0.193 | 0.161 | 0.022 | 0.214 | 0.897 | 0.947 | 3.49 |
| Wan2.6 | 0.671 | 0.203 | 0.090 | 0.172 | 0.050 | 0.162 | 0.874 | 1.000 | 3.22 | |
| Kling | 0.821 | 0.327 | 0.182 | 0.342 | 0.017 | 0.259 | 0.901 | 1.000 | 3.85 | |
| LTX-2 | 0.785 | 0.208 | 0.128 | 0.244 | 0.012 | 0.143 | 0.887 | 0.500 | 2.91 | |
| Sora2 | 0.853 | 0.281 | 0.349 | 0.275 | 0.031 | 0.247 | 0.910 | 0.947 | 3.89 | |
| 具身 | Cosmos | 0.796 | 0.250 | 0.205 | 0.253 | 0.080 | 0.123 | 0.846 | 0.733 | 3.29 |
| GigaWorld | 0.871 | 0.305 | 0.085 | 0.278 | 0.028 | 0.205 | 0.887 | 0.900 | 3.56 | |
| LVP | 0.880 | 0.425 | 0.043 | 0.623 | 0.009 | 0.218 | 0.900 | 0.952 | 4.05 | |
| Vidar | 0.734 | 0.188 | 0.152 | 0.177 | 0.065 | 0.161 | 0.882 | 0.941 | 3.30 | |
| Wow | 0.887 | 0.249 | 0.053 | 0.257 | 0.027 | 0.193 | 0.900 | 0.952 | 3.52 | |
| Ours | 0.914 | 0.566 | 0.343 | 0.671 | 0.011 | 0.208 | 0.883 | 1.000 | 4.60 |
运动保真度表现突出(HSD 0.566),场景一致性高(0.914),逻辑约束满足率满分。
| 模型 | GR1-Env PA | GR1-Env IF | GR1-Object PA | GR1-Object IF | GR1-Behavior PA | GR1-Behavior IF | 总分 |
|---|---|---|---|---|---|---|---|
| Cosmos-sft | 0.709 | 0.655 | 0.775 | 0.720 | 0.649 | 0.621 | 4.129 |
| LVP | 0.810 | 0.772 | 0.745 | 0.829 | 0.713 | 0.889 | 4.758 |
| Vidar | 0.445 | 0.647 | 0.478 | 0.726 | 0.394 | 0.651 | 3.341 |
| GigaWorld | 0.621 | 0.933 | 0.500 | 0.852 | 0.426 | 0.884 | 4.216 |
| Wow | 0.793 | 0.826 | 0.755 | 0.849 | 0.809 | 0.696 | 4.728 |
| Ours | 0.828 | 0.793 | 0.840 | 0.878 | 0.781 | 0.832 | 4.952 |
物体级组合泛化能力突出(GR1-Object IF: 0.878),物理对齐在所有子集上表现一致。
| 类型 | 模型 | 指令 (0-3) | 帧质量 | 时序 | 牛顿定律 | 质量守恒 | 流体 | 穿透 | 重力 | 物理 | 总分 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 通用 | Veo3 | 2.52 | 0.98 | 0.95 | 1.00 | 0.89 | 0.99 | 0.91 | 1.00 | 4.80 | 9.25 |
| Wan2.6 | 2.50 | 0.99 | 0.95 | 1.00 | 0.89 | 0.99 | 0.94 | 1.00 | 4.83 | 9.27 | |
| Sora2 | 2.21 | 0.96 | 0.93 | 1.00 | 0.91 | 0.99 | 0.95 | 1.00 | 4.84 | 8.93 | |
| Kling | 1.59 | 0.97 | 1.00 | 1.00 | 1.00 | 1.00 | 1.00 | 1.00 | 5.00 | 8.55 | |
| LTX-2 | 1.97 | 0.69 | 0.62 | 0.99 | 0.60 | 1.00 | 0.73 | 1.00 | 4.32 | 7.61 | |
| 具身 | Cosmos | 2.14 | 1.00 | 0.94 | 1.00 | 0.92 | 1.00 | 0.94 | 1.00 | 4.86 | 8.94 |
| LVP | 2.01 | 0.89 | 0.91 | 1.00 | 0.93 | 0.99 | 0.95 | 1.00 | 4.87 | 8.67 | |
| GigaWorld | 2.13 | 0.59 | 0.46 | 1.00 | 0.48 | 0.99 | 0.69 | 0.98 | 4.13 | 7.31 | |
| Vidar | 1.62 | 0.54 | 0.45 | 1.00 | 0.56 | 1.00 | 0.85 | 1.00 | 4.40 | 7.01 | |
| Wow | 2.05 | 0.76 | 0.65 | 1.00 | 0.65 | 0.99 | 0.81 | 1.00 | 4.45 | 7.91 | |
| Ours | 2.33 | 0.87 | 0.85 | 1.00 | 1.00 | 1.00 | 0.94 | 1.00 | 4.94 | 8.99 |
| 类型 | 模型 | I2V-Bg | I2V-S | Aes | Img | Bg-Con | Mot | Sub-Con | O-Con | 质量 | 领域 | 总分 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 通用 | Veo3 | 0.975 | 0.980 | 0.526 | 0.698 | 0.938 | 0.994 | 0.927 | 0.128 | 0.771 | 0.882 | 0.827 |
| Wan2.6 | 0.856 | 0.843 | 0.514 | 0.719 | 0.906 | 0.978 | 0.843 | 0.136 | 0.724 | 0.832 | 0.778 | |
| Sora2 | 0.981 | 0.973 | 0.487 | 0.672 | 0.961 | 0.994 | 0.954 | 0.129 | 0.769 | 0.841 | 0.805 | |
| Kling | 0.982 | 0.979 | 0.521 | 0.699 | 0.920 | 0.990 | 0.927 | 0.124 | 0.768 | 0.874 | 0.821 | |
| LTX-2 | 0.948 | 0.955 | 0.506 | 0.622 | 0.932 | 0.986 | 0.904 | 0.118 | 0.746 | 0.845 | 0.796 | |
| 具身 | LVP | 0.979 | 0.981 | 0.515 | 0.679 | 0.954 | 0.991 | 0.962 | 0.116 | 0.772 | 0.812 | 0.792 |
| GigaWorld | 0.957 | 0.944 | 0.495 | 0.641 | 0.925 | 0.984 | 0.892 | 0.128 | 0.746 | 0.841 | 0.794 | |
| Wow | 0.967 | 0.957 | 0.517 | 0.689 | 0.941 | 0.980 | 0.929 | 0.111 | 0.761 | 0.786 | 0.774 | |
| Vidar | 0.935 | 0.922 | 0.501 | 0.573 | 0.912 | 0.982 | 0.863 | 0.120 | 0.726 | 0.810 | 0.768 | |
| Cosmos | 0.974 | 0.973 | 0.470 | 0.663 | 0.940 | 0.989 | 0.931 | 0.160 | 0.763 | 0.840 | 0.802 | |
| Ours | 0.956 | 0.943 | 0.455 | 0.649 | 0.956 | 0.990 | 0.933 | 0.124 | 0.751 | 0.857 | 0.804 |
领域理解能力突出(0.857),运动平滑度优异(0.990),体现了一致的时序连贯性。
引用#
如果我们的工作对您有帮助,欢迎引用。
@article{qwenrobot-world,
title={Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
author={Qwen Team},
year={2026}
}