Qwen-RobotWorld:无界世界,赋能具身智能体
论文 具身智能要求智能体能够在真实物理环境中感知、推理并采取行动,世界模型为此提供了一条可规模化的学习路径。然而,现有方法面临一个核心困境: 通用视频生成模型 拥有丰富的视觉先验,但 对具身物理规律的建模能力不足 。 领域专用的具身模型 则局限于特定场景, 难以跨构型泛化 。 Qwen-RobotWorld 以自然语言为统一动作接口,弥合了这一鸿沟。 一句简单的指令——如 "拿起红色杯子放到架子上" ——本身就包含了完整的动作序列、目标状态与物理约束, 无需任何机器人专属的控制接口 。由此, 操作、自动驾驶与室内导航 得以在同一模型中联合训练,让不同领域的物理知识彼此增益。 语言统一动作空间 :通用世界知识与具身领域知识在同一个模型内相互强化,带来 跨场景、跨任务的物理泛化能力 。 核心亮点 # Top-Tier 4 项基准综合表现 20+ 统一的机器人构型 8.6M 跨场景训练数据对 1300+ 操作技能覆盖 语言驱动的统一动作接口 — 自然语言将 20+ 种机器人构型 和 500+ 种动作类别 标准化为统一接口,实现跨场景联合训练 双流扩散世界模型 — MMDiT 搭配 Qwen2