Qwen-RobotManip:对齐先行,规模化通用机器人操作基础模型
GitHub 论文 Qwen-Omni × Qwen-RobotManip — Qwen-Omni 观察场景,通过语音提出随机的操作任务,并实时判断Qwen-RobotManip的执行结果。以下视频展示了 Qwen-RobotManip 在 无预定义任务 的情况下完成Qwen-Omni给出的任务的全流程,体现了模型的开放式指令跟随与泛化能力。 经过多种机器人平台和任务的验证,Qwen-RobotManip展现出 新场景适应、未见语言指令跟随以及跨构型迁移 等泛化能力。 查看更多真机评测视频 语言和多模态基础模型的泛化能力,源于两个条件:异构数据可以在统一框架下对齐,海量且低成本的互联网数据让不同来源的训练信号相互增强。机器人操作能否走通这条路径? 与文本或图像不同,操作数据天然具有异构性、采集成本高、多样性有限等特点,因此其规模化训练极具挑战性。如何在统一表征的同时实现数据规模化,一直是一个悬而未决的难题。 Qwen-RobotManip 是基于 Qwen-VL 构建的通用视觉-语言-动作(VLA)基础模型。它的核心是一套统一对齐框架,从表征、运动、行为三个维度对齐操作数据,让多源大规