Qwen-VLA:从看懂世界走向执行动作
GitHub Paper Demo 过去几年,多模态大模型已经能够越来越好地理解图像、视频和真实世界场景:识别物体、理解空间关系、回答视觉问题,并完成复杂的多模态推理。 但对于具身智能来说,“看懂世界”只是第一步。真正的智能体还需要进一步做到:理解任务目标,在物理世界中执行动作,并在不同机器人形态、不同环境和不同任务中保持泛化能力。 这正是 Qwen-VLA 的出发点。 Qwen-VLA 是一个通用视觉-语言-动作模型。它基于 Qwen 多模态骨干模型,将视觉感知、语言理解和空间推理能力进一步扩展到连续动作生成和轨迹预测,让模型不仅能“看”和“想”,也能开始“做”。 一个模型,覆盖多类具身任务 # 传统具身智能系统往往是高度专门化的:一个模型解决桌面操作,一个模型解决导航,另一个模型适配某种机器人平台。这种方式在单点任务上有效,但很难扩展到更多任务、更多环境和更多机器人形态。 Qwen-VLA 探索的是一条更统一的路线: 能否用一个通用策略模型,同时支持机器人操作、视觉语言导航和跨机器人形态控制? 在 Qwen-VLA 中,机器人操作和视觉语言导航被统一为同一个问题:在视觉观察、语言指