Qwen-Robot Suite:迈向物理世界智能的基础模型套件
Qwen 系列基础模型已在物理世界的感知与理解上展现出强大能力,但 看懂不等于能行动 ——从视觉语言理解到物理控制,这道鸿沟仍是具身智能的核心瓶颈。 Qwen-Robot Suite 用三个基础模型来弥补这一鸿沟—— Qwen-RobotNav 、 Qwen-RobotManip 与 Qwen-RobotWorld 。Nav 通过自适应视觉分配策略将五类导航任务统一到单一模型;Manip 将异构机器人数据对齐到统一空间,实现大规模跨机型训练;World 以自然语言作为动作接口,将 20 余种机器人本体纳入同一世界模型联合训练。三者协同,使通用智能直接驱动物理行动成为可能。 Qwen 系列多模态基础模型在物理世界理解方面已取得显著进展。Qwen-VL 能解析复杂的空间关系,在杂乱场景中识别物体,执行多步指令,并对物理构型进行推理——为物理智能体奠定了认知基础。视觉语言模型已经能够进行语言层面的规划: “去厨房,找到红色杯子,拿起来,放到架子上。” 但理解物理世界与在其中行动是两回事。 能规划出上述步骤的模型,却无法生成真正执行它们的运动指令。这本质上是一个对齐问题——语言指令与物理动作处