网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

0
分享至



近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。

例如,机器人完成一句简单的指令:

“穿过走廊,在窗户旁边找到椅子。”

机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?” 这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。

为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。

论文提出的 AgentVLN 在 R2R-CE 和 RxR-CE 等主流 VLN 基准上取得领先性能,同时仅使用 3B 规模模型,并支持 Jetson 等边缘设备实时运行。 该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。



  • 论文标题:AgentVLN: Towards Agentic Vision-and-Language Navigation
  • 代码链接:https://github.com/Allenxinn/AgentVLN
  • 项目主页:https://allenxinn.github.io/AgentVLN/
  • 数据集链接:https://huggingface.co/datasets/allenxinn/AgentVLN-Instruct

核心思路



AgentVLN 使得机器人不再要求一个巨大模型直接完成所有事情,而是让视觉语言模型负责:“理解任务目标、分析环境与调度不同技能”。 而具体执行,例如建地图、避障、移动和定位等功能则交给专门设计的技能模块完成。该工作将导航过程建模为部分可观测半马尔可夫决策过程,并将技能划分为感知层技能和规划层技能,让智能体根据环境状态动态调用不同能力。这种设计类似人类完成导航任务的方式:

看到环境 → 思考路线 → 行动 → 根据反馈调整。

机器人不需要每一步都重新学习,而是像人一样调用已有能力。同一个 AgentVLN “大脑”,可以根据不同机器人的身体能力,替换对应的底层技能模块,从而快速适配不同机器人平台。



通过插件式底层技能库设计,AgentVLN 可以在不重新训练大规模视觉语言模型的情况下,通过扩展或替换技能实现对新环境和新任务的适应。

把 3D 世界 “翻译” 为 VLM 能看懂的 2D 提示

视觉语言模型最大的优势,是理解二维图像中的语义信息。 但机器人导航的问题在于:真实世界是三维的。机器人需要知道:“应该往哪里走?”,而 VLM 看到的是:“图片里的哪个位置代表目标方向?”,如何连接这两个空间,一直是机器人自主导航领域的重要挑战。





为此,AgentVLN 提出:跨空间表示映射机制(Cross-space Representation Mapping)。其核心思想是:先利用 SLAM 作为感知技能计算真实环境中的可行路径,再将三维路径信息映射回二维图像空间,让 VLM 直接在视觉空间中进行决策。

机器人首先调用感知技能,对当前环境进行分析:1)构建三维空间地图;2) 获取环境拓扑结构;3)计算可通行区域;4)生成候选导航路径点。 随后,AgentVLN 利用相机模型,将这些三维可行路径点投影到当前摄像头视角下的二维图像中。最终,原本复杂的三维路径规划问题,被转换为:

“在图像中选择最符合语言指令的路径点。”

也就是说,模型不再需要直接从开放空间中预测一个精确坐标,而是将:开放性的精细点坐标生成问题(open-ended coordinate generation)转化为:基于视觉提示的路径选择问题(choice-based selection)。

这种方式充分发挥了 VLM 强大的视觉语义理解能力,同时避免其直接进行复杂三维几何推理。该机制通过将感知层计算得到的三维路径点投影到二维图像平面,生成像素级对齐的视觉提示,使 VLM 能够直接在视觉空间中选择符合指令的路径,并进一步恢复为三维导航控制信息。

上下文驱动的自我纠错机制

现实物理环境下,机器人可能遇到:“家具遮挡、光线变化;摄像头看不到目标;行进过程中产生误差。” 如果机器人一直按照原计划前进,小错误可能不断累积,最终导致完全偏离目标。

因此,AgentVLN 加入了上下文驱动的自我纠错机制。当机器人发现:当前路线不可见;或者环境和指令不匹配;它不会盲目前进,而是主动执行探索动作:转身观察; 调整方向; 搜索新的路径。

该机制能够在遮挡、盲区以及轨迹偏移情况下生成细粒度探索动作,从而减少长期导航中的误差累积。

主动调用感知技能补足空间信息

AgentVLN 提出 Query-Driven Perceptual Chain-of-Thought(QD-PCoT),让机器人具备 “主动获取信息” 的能力。其核心思想是:

当模型无法确定目标位置时,不再盲目预测,而是主动提出问题,并调用感知技能补充缺失信息。

当机器人无法判断椅子的距离时,会主动询问:

“前方椅子距离我有多远?”

随后调用深度感知模块获取空间信息,并结合反馈完成目标定位。相比直接回归目标坐标的方法,QD-PCoT 将导航过程转变为:

主动提问 → 获取信息 → 更新认知 → 决策行动

从而赋予机器人类似人类的 “自我认知” 能力,使其能够判断 “自己缺少什么信息”,并主动调用相应技能完成补充。论文实验表明,引入 QD-PCoT 后,AgentVLN 在无需增加额外参数的情况下进一步提升导航性能,有效缓解二维视觉中的深度歧义问题。

VLN 模型的端侧部署

很多先进视觉语言模型参数规模巨大,需要依赖云端服务器推理计算。AgentVLN 选择轻量化路线,采用 Qwen2.5-VL-3B 作为核心底座模型,并通过模块化设计避免额外的大规模三维视觉模块,实现了在 Jetson 边缘设备上的本地运行。



AgentVLN 不仅在多个 VLN 基准测试中超过已有方法,同时保持较小参数规模。研究团队将系统部署在四足机器狗、人形机器人平台上,通过摄像头获取环境信息,再利用感知技能完成地图构建和路径规划。





结语

AgentVLN 让机器人不再依赖一个庞大的端到端模型解决所有问题,而是赋予 VLM “大脑” 的角色:负责理解任务、分析环境和决策规划,再通过技能调用连接 SLAM、定位和控制模块,完成真实世界中的自主行动。未来,随着大模型推理能力不断增强,以及机器人感知、运动和操作技能持续完善,机器人有望从 “被预先编程执行任务”,逐渐走向 “理解目标、自主规划、主动学习”,真正成为能够与物理世界交互的智能体。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
最后大决战开始了,也门领导人萨布里宣布,解放也门全境,把伊朗革命卫队以及也门胡塞武装赶出去!

最后大决战开始了,也门领导人萨布里宣布,解放也门全境,把伊朗革命卫队以及也门胡塞武装赶出去!

吃瓜小侦探
2026-09-08 21:38:50
75:72!中国女篮75-72险胜波多黎各,一战诞生三大不争的事实!

75:72!中国女篮75-72险胜波多黎各,一战诞生三大不争的事实!

田先生篮球
2026-09-10 03:45:18
贾乃亮李小璐同框,两人已离婚7年,甜馨发布一家三口视频,贾乃亮:爸爸永远是你最坚实的后盾;李小璐:把爱传递

贾乃亮李小璐同框,两人已离婚7年,甜馨发布一家三口视频,贾乃亮:爸爸永远是你最坚实的后盾;李小璐:把爱传递

扬子晚报
2026-09-10 07:27:35
新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

细说职场
2026-09-09 10:19:14
跟何超琼同住14载,至今没领证没生娃没名分,地位早已超越陈百强

跟何超琼同住14载,至今没领证没生娃没名分,地位早已超越陈百强

荒野老五
2026-09-10 06:26:55
完爆古德温+碾压布朗!NBA双能卫或被广东队抢下,总决赛稳了?

完爆古德温+碾压布朗!NBA双能卫或被广东队抢下,总决赛稳了?

绯雨儿
2026-09-10 10:03:01
不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

一些小事
2026-09-09 08:59:44
刚刚,苹果首款折叠屏iPhone Duo发布!卖两万,它还真配

刚刚,苹果首款折叠屏iPhone Duo发布!卖两万,它还真配

AppSo
2026-09-10 05:29:28
格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

观鱼听雨
2026-09-09 23:58:17
真正大麻烦来了!熊某叫嚣别眼红,封号仅开胃菜,大学受举报围攻

真正大麻烦来了!熊某叫嚣别眼红,封号仅开胃菜,大学受举报围攻

陈博世财经
2026-09-09 10:33:48
悲催!女生发布151条视频从未让男友露脸,他花8500元帮买手机,才换来第一次同框,网友:我一个客户被捞女捞了七八个W,手都没牵过

悲催!女生发布151条视频从未让男友露脸,他花8500元帮买手机,才换来第一次同框,网友:我一个客户被捞女捞了七八个W,手都没牵过

火山詩话
2026-09-10 08:53:49
普京亲口保证,让特朗普放一万个心,俄军打完乌克兰绝不打欧洲

普京亲口保证,让特朗普放一万个心,俄军打完乌克兰绝不打欧洲

温读史
2026-09-10 05:13:40
宇树科技再创新低,今天跌到了498,上市17个交易日大跌55%!

宇树科技再创新低,今天跌到了498,上市17个交易日大跌55%!

财经智多星
2026-09-10 11:09:13
云南昆明警方通报“鲜花饼吐痰”:造谣者已被行拘

云南昆明警方通报“鲜花饼吐痰”:造谣者已被行拘

澎湃新闻
2026-09-10 10:06:04
挪威首相:泽连斯基所乘飞机“险些被无人机击中”

挪威首相:泽连斯基所乘飞机“险些被无人机击中”

环球网资讯
2026-09-10 09:43:14
郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

翰飞观事
2026-09-08 16:52:26
哈里梅根对王室再度宣战,不做平民要当公众人物!?英国网友:庶民,快滚!

哈里梅根对王室再度宣战,不做平民要当公众人物!?英国网友:庶民,快滚!

悦居英国
2026-09-09 20:26:42
注意!商业地产到期需补缴巨款!

注意!商业地产到期需补缴巨款!

樱桃大房子
2026-09-09 12:12:20
自相矛盾?刘翔称退役11年没接受编制岗位 却一直领工资补助98万

自相矛盾?刘翔称退役11年没接受编制岗位 却一直领工资补助98万

手工制作阿歼
2026-09-10 10:27:06
形体模特李琪火了!人高马大,网友:一般男人难驾驭

形体模特李琪火了!人高马大,网友:一般男人难驾驭

烟浔渺渺
2026-09-10 06:02:34
2026-09-10 13:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13958文章数 142731关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone Duo拿出了苹果的看家本领 打工人可能买不起了

头条要闻

iPhone Duo拿出了苹果的看家本领 打工人可能买不起了

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

艺术
教育
房产
公开课
军事航空

艺术要闻

教师节 | 中国著名油画家们的老师

教育要闻

不拼资历拼“被看见”:一所新建小学如何用九年成为“最美”

房产要闻

别不服!海南的亿万富豪,只有不到300个!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版