Qwen 系列多模态基础模型在物理世界理解方面已取得显著进展。Qwen-VL 能解析复杂的空间关系,在杂乱场景中识别物体,执行多步指令,并对物理构型进行推理——为物理智能体奠定了认知基础。视觉语言模型已经能够进行语言层面的规划:“去厨房,找到红色杯子,拿起来,放到架子上。”
但理解物理世界与在其中行动是两回事。 能规划出上述步骤的模型,却无法生成真正执行它们的运动指令。这本质上是一个对齐问题——语言指令与物理动作处于不同的表示空间,仅凭感知无法跨越。更大的挑战在于:具身数据与互联网文本截然不同——天然异构、采集成本高、多样性有限。一段导航轨迹、一次遥操抓取、一段行车记录,分别处于不同的动作空间、观测格式和机器人形态中。简单地将它们混合在一起,只会产生冲突而非协同。
Qwen-Robot Suite 用三个基础模型来弥合这一鸿沟,Qwen-RobotNav、Qwen-RobotManip 与 Qwen-RobotWorld 分别将语言与不同类型的物理动作对齐。我们在指令泛化能力和物理规律一致性两个方向上均取得了重要进展。本文也将探讨这些模型作为底层工具构建通用智能体系统的可能性。
- Qwen-RobotNav:物理智能体的行动入口 — 通过自适应的视觉分配策略和工具接口,把视觉语言能力接入移动控制,统一了指令跟随、点/目标导航、目标追踪和自动驾驶四类任务。
- Qwen-RobotManip:物理智能体的交互基石 — 通过规范状态-动作空间和相机坐标系下的末端执行器增量位姿,把视觉语言能力接入操作控制,基于完全由开源数据构建的 >38,100小时操作数据实现了大规模多机型训练。
- Qwen-RobotWorld:物理智能体的无限世界 — 通过自然语言动作接口,把视觉语言能力接入世界动力学预测,让同一个世界模型能够跨操作、驾驶和导航场景预测符合物理规律的未来。
Qwen-RobotNav:物理智能体的行动入口#
导航智能体要操作任何物体,首先得能到达目标位置。然而不同导航任务对历史信息的需求差异巨大——指令跟随需要保留长程上下文,目标追踪则几乎只关注最近几帧。任何固定的视觉分配策略都无法同时满足这两类需求。
Qwen-RobotNav 的核心思路是将视觉分配策略本身参数化:任务模式选择导航行为(指令跟随、目标搜索、目标追踪、自动驾驶),可调节参数(视觉 token 预算、时间衰减、单相机权重、帧采样模式)决定视觉历史的编码方式。模型在 1,560 万条样本上训练,同时联合视觉语言数据以保留感知能力,一套权重统一五类导航任务。
这套参数化接口也使 Qwen-RobotNav 天然适合作为智能体系统中的导航模块——上层规划器将长程目标分解为子任务,在执行过程中动态切换任务模式和上下文策略,通过反复调用同一模型来组合复杂行为。由此,整个系统具备了持久记忆与长程推理能力,可处理多步导航、环境取证和循证问答等复杂任务。
核心亮点:
8项SOTA
Tracking、Driving 与 EQA
即接口
零架构修改
驱动
迈向EQA新时代
零样本真机部署
- 统一多域导航: 单一模型、单组权重,在 5 个导航领域达到 SOTA — VLN-CE RxR 76.5% SR、HM3Dv2 目标搜索 75.6% SR(仅 RGB,超越所有深度方法)、EVT-Bench 90.0% 跟踪率、NAVSIM 91.4 PDMS,以及 3 个 EQA 基准新纪录 — 2B 到 8B 参数一致提升
- 可控观测协议: 四个控制轴(视觉词元预算、时间衰减、逐相机权重、帧采样模式)作为推理时参数暴露,训练时逐样本随机化,无需重新训练或修改 Qwen3-VL 架构即可适配任意配置
- 智能体导航系统: 作为双层系统中可重配置的导航原语,上层规划器(Qwen3.6-Plus)分解长时序目标并调度可配置的导航调用,配合双层记忆机制 — 在 EXPRESS-Bench 上提升 15.4%,导航步数减少 77%
- 开放环境泛化: 在 Unitree Go2 四足机器人上零样本部署,仅使用单个低分辨率相机,在开放真实环境与自由自然语言指令下展现出强大的泛化能力,无需任何环境特定微调
Qwen-RobotNav 基准测试结果
零样本部署在宇树 Go2 四足机器人(NVIDIA Jetson Thor,推理延迟 196ms),仅使用机器人自带的低分辨率摄像头。机器人在一套从未见过的公寓中,根据逐步的语言指令跨多个房间执行任务。
我们在一个从未见过的展览馆中评估往返导航任务:机器人首先根据语言指令从客厅导航 21.78 米至病房,随后接收反向指令,要求精确地沿原路返回。这一任务极具挑战性,因为模型需要在长距离中保持空间感知,在正向和反向两个方向上识别多样的视觉地标,并仅凭语言实现精准的双向位置控制。
单套模型权重同时服务于腿式机器人导航与自动驾驶。在 NAVSIM 闭环驾驶测试中,Qwen-RobotNav-4B 达到 91.4 PDMS。
Qwen-RobotManip:物理智能体的交互基石#
操作物理智能体需要与真实世界交互,例如通过机械臂完成操作任务。然而,产线上的工业臂与厨房中的服务臂,执行的抓取动作视觉上可能非常相似,但关节配置和动作空间却截然不同。核心挑战在于让形态各异的机器人在表示层面实现兼容,使跨机器人、跨数据源的大规模训练产生协同效应而非相互冲突。
Qwen-RobotManip 以 Qwen3.5-4B VL 为骨干、结合流匹配 DiT 动作头,通过三种机制解决这一问题。统一的 80 维状态-动作表示在单臂、双臂、灵巧手和移动平台等本体间共享。相机坐标系下的末端执行器增量位姿动作,使视觉上相似的运动在不同机器人之间数值上也相近,从而屏蔽形态差异。上下文策略自适应将执行历史视为隐式的本体标识,实现推理时在线行为校准。
一旦表征体系统一,数据壁垒随之降低。我们利用开源的 11,320 小时的机器人数据、 开源的 1,933 小时 第一人称人类视频,以及 人-机迁移数据合成管线 从人类视频合成的跨 15 个本体的 24,808 小时 机器人数据(共计 >38,100 小时 )训练VLA模型。仅依靠开源数据,模型即涌现出对扰动的鲁棒性、零样本指令跟随、自主错误恢复和跨本体迁移等泛化能力。
核心亮点:
三维跨本体对齐
跨 15 个本体
全基准最优
包揽冠亚,领先季军 20%
- 统一跨本体对齐框架 — 统一的 80 维状态-动作表示兼容多样化本体,相机坐标系末端执行器增量位姿使视觉相似运动数值相近,上下文策略自适应将执行历史作为隐式本体标识——三者共同实现跨本体一致信号提取
- 大规模人-机迁移数据合成 — 管线将 1,933 小时第一人称人类视频,经由动作重定向、手部去除与补绘、仿真渲染及深度辅助融合,转化为跨 15 个本体的 24,808 小时机器人演示,配合多阶段数据策划管线确保数据质量
- 分布外泛化: LIBERO-Plus 91.4%(超越 π0.5 +7.0),RoboTwin-C2R Hard 69.4%(超越 π0.5 +21.5),RoboCasa365 Composite-Unseen 14.9%(第二名的 3 倍),EBench 45.6%(超越第二名 +18.5);RoboTwin-IF 72.0%(超越 π0.5 +22.4),证实了可靠的语言条件控制能力;RoboTwin-XE 零样本跨本体迁移性能达到先前最优的 3 倍
- 真实环境表现: RoboChallenge Table30 v1 通用赛道以 45% SR 排名第一,包揽冠亚,领先季军 20%;在真实机器人平台上的域内与域外任务、少样本适应及跨本体技能迁移中达到先前最优的 2 倍
单一通用策略处理跨多类物体、任务和场景的复杂操作。
在真实环境(第一排)和仿真(第二排)中执行多样化的未见指令。
在其他本体上训练的任务可零样本迁移至新本体执行(第一排),并通过少量示教快速适应全新任务(第二排)。
Qwen-RobotWorld:物理智能体的无限世界#
想象真实世界的经验是机器人领域最稀缺的资源。Qwen-RobotWorld 通过直接学习世界的状态转移函数来解决这一问题:给定当前观测和一个自然语言动作,预测世界接下来将呈现的样子。关键的设计选择是将所有动作以自然语言表达——这将末端执行器位姿、转向指令和导航路标点统一为单一接口,使 20 余种本体类型和 500 余个动作类别得以在具身世界知识语料库(860 万视频-文本对,逾 2 亿帧)下协同训练。60 层双流 MMDiT 将 Qwen2.5-VL 的语义表示与视频隐变量深度耦合。将完整的多模态大语言模型作为动作编码器——而非轻量级文本编码器——是关键所在:它带来了内化的世界知识——手臂是刚体、液体会扩散、物体会下落——从而隐式地将生成约束为物理上可信的未来。每个领域相互强化:操作教会接触物理,驾驶教会大尺度三维几何,导航教会房间级别的空间推理。
核心亮点:
(4 个基准)
统一训练
训练样本对
技能类别
- 语言驱动的统一动作接口 — 自然语言将 20 余种机器人本体和 500 余个动作类别标准化为统一的训练接口,使操作、驾驶、导航和人机迁移得以联合训练;每个领域互相强化
- 双流 MMDiT + Qwen2.5-VL 动作编码器 — 以完整的多模态大语言模型(而非轻量级文本编码器)作为动作编码器,将复杂的组合指令解析为精确的生成信号,并内化物理世界知识,可作为合成数据引擎、闭环策略评估器和动作规划器
- 榜单排名: EWMBench 总分第一(运动保真度超越亚军 33%)及 DreamGen Bench 第一;开源模型中 WorldModelBench 第一(牛顿定律、质量守恒、流体动力学等物理规律遵循完美)及 PBBench 第一
- 核心能力: 细粒度语言控制(改变单个关键词即产生不同的未来);跨 8 种以上本体的人机迁移,具备多视角一致生成;在 RoboTwin-IF 上的零样本鲁棒性
改变单个关键词——物体、目标或动作动词——即可产生相应不同的未来。世界模型真正理解语言,而非仅仅进行模式匹配。
给定单条指令,Qwen-RobotWorld 能够跨多个相机视角生成时间和空间上均一致的视频——这对于仿真到真实的迁移与多相机策略训练至关重要。
给定人类演示,Qwen-RobotWorld 能够跨多种本体生成真实的机器人执行效果——无需遥操作。
驾驶教会大尺度三维几何与多智能体动力学;导航教会房间级别的空间推理。每个领域相互强化。
驾驶
室内导航
从模型到智能体:形成闭环#
三个模型各自独立可用——但由于它们都提供语言优先的接口,通用 Qwen 模型可以将它们作为物理世界工具进行组合,将通用智能直接连接到物理行动。我们还有一个内部项目 Qwen-RobotClaw——一个机器人智能体框架,使 Qwen VLM 智能体能够将 Qwen-Robot Suite 模型作为物理世界工具调用,同时妥善管理长程任务所需的上下文与记忆,推动物理智能走向更通用、更复杂的真实应用场景。以下是目前已实现的早期示例。
Qwen-Omni 观察场景,通过语音随机提出操作任务,并对执行结果进行实时评判。每段视频展示了 Qwen-RobotManip 即时完成任务的过程,无需预定义的任务列表——这证明了通用多模态模型完全可以充当任务提出者与评估者的角色,而套件模型则负责物理执行。
我们搭建了基于 VLM 驱动的智能体-VLA 系统:Qwen-3.5 担任上层规划器,Qwen-RobotManip 负责底层执行。借助其在场景理解、空间推理和任务进度评估方面的能力,Qwen-3.5 将复杂的高层指令分解为一系列原子任务,再由 VLA 逐个执行。这种分工大幅提升了模型在分布外场景和指令下的鲁棒性。
以桌面清理任务为例:在一个杂乱的全新场景中,直接使用 VLA 执行抽象指令会出现明显异常行为(右)。而当 Qwen-3.5 作为规划器时,系统能实时将任务分解为细粒度的原子任务(左),VLA 每次只需专注执行一个简单步骤,从而展现了组合泛化能力。
我们还观察到,子任务分解能帮助系统从反复失败的循环中恢复。当上层智能体识别到机器人执行陷入僵局时,会分配新的子任务,使执行得以继续推进,显著提升了整体成功率。
智能体 + VLA(成功)
仅 VLA(失败)
通过工具调用,将智能体系统与Qwen-RobotNav 结合起来,我们在长程 3D 物理世界探索任务上相较于先前最优取得了显著提升,包括 HM-EQA、MT-HM3D 和 EXPRESS-Bench 等具身问答基准。同时,这种开放世界探索能力也已经可以部署到真实环境中,如下方 demo 所示。后续我们将发布更多技术细节。
第一个 demo 中,用户要求智能体在真实建筑中找到一个可用的卫生间。智能体首先扫描周围环境,沿走廊线索寻找卫生间标识;发现第一个卫生间旁贴有清晰的 "Cleaning in Progress / 暂停使用" 标牌后,判断该卫生间不可用,随即重新规划路线前往建筑另一侧寻找替代选项。在通过视觉证据确认第二个卫生间开放且可进入后,智能体返回了一个有实证支撑的答案。
第二个 demo 则是我们此前随 Qwen3.7-Max 一并发布的演示:智能体通过调用 Qwen-RobotNav,在开放园区环境中进行自主探索,在过程中修正偏差,并最终找回丢失的雨伞。
我们提供了一个实验性功能——Chat2Robot——您可以直接在浏览器中与机器人对话。只需输入自然语言指令,即可观察机器人的实时响应。欢迎体验!
注意: Chat2Robot 目前仅支持 Qwen-RobotManip。当前部署的策略仅使用 RoboTwin-Clean 数据集进行训练,该数据集仅包含 50 个任务,因此它并非一个完美的策略。我们希望借此展示模型一定程度的零样本指令跟随能力。该功能仍在持续开发中,可能尚不完善——欢迎反馈与建议!
感谢 D-Robotics(地瓜机器人) 对该功能的支持。
未来展望#
物理世界智能仍处于起步阶段。涉及复杂接触的长程任务、终身学习、通用规划器与物理执行器的深度融合、以及更丰富的人-机-环境交互,都仍是开放问题。但前行的路径正愈发清晰:从强大的多模态理解出发,将视觉语言表示空间桥接至每一类物理行动,扩大训练规模,并以泛化能力作为衡量成功的北极星。
一个能够去往任何地方、做任何事情,并预见行动后果的物理智能体。
这是我们的目标——而 Qwen-Robot Suite 是迈向它的第一个完整步伐。
引用#
@article{qwenrobotnav,
title={Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System},
author={Qwen Team},
year={2026}
}
@article{qwenrobotmanip,
title={Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
author={Qwen Team},
year={2026}
}
@article{qwenrobotworld,
title={Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
author={Qwen Team},
year={2026}
}