Qwen-RobotNav:面向智能体驱动的规模化通用导航模型
GitHub 论文 搭建智能体驱动的导航系统需要一个可配置上下文内容管理的通用导航模型。指令跟随、物体搜索、目标跟踪和自动驾驶等任务虽然共享相同的感知-规划骨干网络,却需要截然不同的视觉信息处理策略。正如大模型工具调用中的模型上下文协议(MCP)为不同工具提供了统一接口,导航模型同样需要一套标准化的接口,在推理时灵活管理多样化的上下文需求。 我们提出了 Qwen-RobotNav ,一个基于 Qwen3-VL 构建的规模化导航模型。它通过 参数化接口 从两个互补维度解决上述问题:任务模式决定导航行为,可控的观测参数(token 预算、时间衰减、相机权重)则决定视觉历史的编码方式。模型在 1560 万条样本 上进行训练,在单一权重下统一五类任务,无需修改架构即可泛化到任意推理时配置,适配智能体系统。 核心亮点: 5大领域 8项SOTA 单一模型统一 VLN、ObjNav、 Tracking、Driving 与 EQA 上下文 即接口 视觉信息管理 零架构修改 智能体 驱动 导航即工具调用+双层记忆 迈向EQA新时代 真实世界零样本泛化 单相机、开放环境 零样本真机部署 统一多域导航: 单