网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

0
分享至



近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。

例如,机器人完成一句简单的指令:

“穿过走廊,在窗户旁边找到椅子。”

机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?” 这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。

为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。

论文提出的 AgentVLN 在 R2R-CE 和 RxR-CE 等主流 VLN 基准上取得领先性能,同时仅使用 3B 规模模型,并支持 Jetson 等边缘设备实时运行。 该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。



  • 论文标题:AgentVLN: Towards Agentic Vision-and-Language Navigation
  • 代码链接:https://github.com/Allenxinn/AgentVLN
  • 项目主页:https://allenxinn.github.io/AgentVLN/
  • 数据集链接:https://huggingface.co/datasets/allenxinn/AgentVLN-Instruct

核心思路



AgentVLN 使得机器人不再要求一个巨大模型直接完成所有事情,而是让视觉语言模型负责:“理解任务目标、分析环境与调度不同技能”。 而具体执行,例如建地图、避障、移动和定位等功能则交给专门设计的技能模块完成。该工作将导航过程建模为部分可观测半马尔可夫决策过程,并将技能划分为感知层技能和规划层技能,让智能体根据环境状态动态调用不同能力。这种设计类似人类完成导航任务的方式:

看到环境 → 思考路线 → 行动 → 根据反馈调整。

机器人不需要每一步都重新学习,而是像人一样调用已有能力。同一个 AgentVLN “大脑”,可以根据不同机器人的身体能力,替换对应的底层技能模块,从而快速适配不同机器人平台。



通过插件式底层技能库设计,AgentVLN 可以在不重新训练大规模视觉语言模型的情况下,通过扩展或替换技能实现对新环境和新任务的适应。

把 3D 世界 “翻译” 为 VLM 能看懂的 2D 提示

视觉语言模型最大的优势,是理解二维图像中的语义信息。 但机器人导航的问题在于:真实世界是三维的。机器人需要知道:“应该往哪里走?”,而 VLM 看到的是:“图片里的哪个位置代表目标方向?”,如何连接这两个空间,一直是机器人自主导航领域的重要挑战。





为此,AgentVLN 提出:跨空间表示映射机制(Cross-space Representation Mapping)。其核心思想是:先利用 SLAM 作为感知技能计算真实环境中的可行路径,再将三维路径信息映射回二维图像空间,让 VLM 直接在视觉空间中进行决策。

机器人首先调用感知技能,对当前环境进行分析:1)构建三维空间地图;2) 获取环境拓扑结构;3)计算可通行区域;4)生成候选导航路径点。 随后,AgentVLN 利用相机模型,将这些三维可行路径点投影到当前摄像头视角下的二维图像中。最终,原本复杂的三维路径规划问题,被转换为:

“在图像中选择最符合语言指令的路径点。”

也就是说,模型不再需要直接从开放空间中预测一个精确坐标,而是将:开放性的精细点坐标生成问题(open-ended coordinate generation)转化为:基于视觉提示的路径选择问题(choice-based selection)。

这种方式充分发挥了 VLM 强大的视觉语义理解能力,同时避免其直接进行复杂三维几何推理。该机制通过将感知层计算得到的三维路径点投影到二维图像平面,生成像素级对齐的视觉提示,使 VLM 能够直接在视觉空间中选择符合指令的路径,并进一步恢复为三维导航控制信息。

上下文驱动的自我纠错机制

现实物理环境下,机器人可能遇到:“家具遮挡、光线变化;摄像头看不到目标;行进过程中产生误差。” 如果机器人一直按照原计划前进,小错误可能不断累积,最终导致完全偏离目标。

因此,AgentVLN 加入了上下文驱动的自我纠错机制。当机器人发现:当前路线不可见;或者环境和指令不匹配;它不会盲目前进,而是主动执行探索动作:转身观察; 调整方向; 搜索新的路径。

该机制能够在遮挡、盲区以及轨迹偏移情况下生成细粒度探索动作,从而减少长期导航中的误差累积。

主动调用感知技能补足空间信息

AgentVLN 提出 Query-Driven Perceptual Chain-of-Thought(QD-PCoT),让机器人具备 “主动获取信息” 的能力。其核心思想是:

当模型无法确定目标位置时,不再盲目预测,而是主动提出问题,并调用感知技能补充缺失信息。

当机器人无法判断椅子的距离时,会主动询问:

“前方椅子距离我有多远?”

随后调用深度感知模块获取空间信息,并结合反馈完成目标定位。相比直接回归目标坐标的方法,QD-PCoT 将导航过程转变为:

主动提问 → 获取信息 → 更新认知 → 决策行动

从而赋予机器人类似人类的 “自我认知” 能力,使其能够判断 “自己缺少什么信息”,并主动调用相应技能完成补充。论文实验表明,引入 QD-PCoT 后,AgentVLN 在无需增加额外参数的情况下进一步提升导航性能,有效缓解二维视觉中的深度歧义问题。

VLN 模型的端侧部署

很多先进视觉语言模型参数规模巨大,需要依赖云端服务器推理计算。AgentVLN 选择轻量化路线,采用 Qwen2.5-VL-3B 作为核心底座模型,并通过模块化设计避免额外的大规模三维视觉模块,实现了在 Jetson 边缘设备上的本地运行。



AgentVLN 不仅在多个 VLN 基准测试中超过已有方法,同时保持较小参数规模。研究团队将系统部署在四足机器狗、人形机器人平台上,通过摄像头获取环境信息,再利用感知技能完成地图构建和路径规划。





结语

AgentVLN 让机器人不再依赖一个庞大的端到端模型解决所有问题,而是赋予 VLM “大脑” 的角色:负责理解任务、分析环境和决策规划,再通过技能调用连接 SLAM、定位和控制模块,完成真实世界中的自主行动。未来,随着大模型推理能力不断增强,以及机器人感知、运动和操作技能持续完善,机器人有望从 “被预先编程执行任务”,逐渐走向 “理解目标、自主规划、主动学习”,真正成为能够与物理世界交互的智能体。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
新加坡总理年薪将达1900万元,排名全球第一,是美国总统的7倍;新加坡部长们收入是世界上最高的政治群体之一

新加坡总理年薪将达1900万元,排名全球第一,是美国总统的7倍;新加坡部长们收入是世界上最高的政治群体之一

极目新闻
2026-09-10 11:16:42
2亿续约赚麻!恩格兰德发力了,阿门投篮大增,火箭定下两个目标

2亿续约赚麻!恩格兰德发力了,阿门投篮大增,火箭定下两个目标

体育火锅T
2026-09-10 11:35:54
继烂尾楼后又现“烂尾车”,23家车企离场,85万辆电车难寻接盘方

继烂尾楼后又现“烂尾车”,23家车企离场,85万辆电车难寻接盘方

体育小柚
2026-09-09 17:33:08
理性消费:3000元拿下续航120公里的电动车,都是72V32AH大电池

理性消费:3000元拿下续航120公里的电动车,都是72V32AH大电池

侃故事的阿庆
2026-09-08 18:10:58
狂赢31分,辽宁队进决赛!柳清瀚砍43分太猛了,决赛将与首钢争冠

狂赢31分,辽宁队进决赛!柳清瀚砍43分太猛了,决赛将与首钢争冠

萌兰聊个球
2026-09-10 18:38:24
“我不能糊弄大家”乌情报局长警告:俄有能力将战争持续至2028年

“我不能糊弄大家”乌情报局长警告:俄有能力将战争持续至2028年

荷兰豆爱健康
2026-09-09 07:21:04
女子接连4次流产,检查却正常!医生发现:她丈夫长年坐电脑前,可乐当水喝,经常吃夜宵,精子DNA碎片率达90%以上……

女子接连4次流产,检查却正常!医生发现:她丈夫长年坐电脑前,可乐当水喝,经常吃夜宵,精子DNA碎片率达90%以上……

都市快报橙柿互动
2026-09-10 13:11:57
强大内核!梅根发布新房布局,室内大草坪与加州无异,回应王室“切割文件”不带怕的!

强大内核!梅根发布新房布局,室内大草坪与加州无异,回应王室“切割文件”不带怕的!

聪明的橙子hj
2026-09-09 17:42:20
虚假宣传诱导签约、违规收集敏感信息……北京金融监管局拆解非法中介多重套路

虚假宣传诱导签约、违规收集敏感信息……北京金融监管局拆解非法中介多重套路

北京商报
2026-09-09 17:29:14
69岁赵本山现状:三亚养老、每天2包烟、8两酒,活成了杨少华的模样

69岁赵本山现状:三亚养老、每天2包烟、8两酒,活成了杨少华的模样

背包旅行
2026-07-31 18:03:34
血战也门:三面绞杀下,胡塞武装被逼入墙角,变天只差最后一步

血战也门:三面绞杀下,胡塞武装被逼入墙角,变天只差最后一步

民间马后炮
2026-09-09 06:25:38
延续47年无8强魔咒!意大利女篮多人泣不成声 帕萨丢绝平球捂脸自责

延续47年无8强魔咒!意大利女篮多人泣不成声 帕萨丢绝平球捂脸自责

颜小白的篮球梦
2026-09-10 09:00:33
特斯拉新款 Model Y 即将发布,迎来全新标志!

特斯拉新款 Model Y 即将发布,迎来全新标志!

XCiOS俱乐部
2026-09-09 14:03:51
从加价神车到降价滞销,雷克萨斯盛景不再

从加价神车到降价滞销,雷克萨斯盛景不再

青橙汽车
2026-09-10 15:37:29
热刺崩溃!25岁穆德里克只踢16分钟就重伤:休战2个月 曾被禁赛2年

热刺崩溃!25岁穆德里克只踢16分钟就重伤:休战2个月 曾被禁赛2年

风过乡
2026-09-10 08:51:15
中国正愁怎么破局呢,日本却"及时"送上了助攻,高市的"愚蠢"帮中国解决了两大问题!

中国正愁怎么破局呢,日本却"及时"送上了助攻,高市的"愚蠢"帮中国解决了两大问题!

扶苏聊历史
2026-09-10 15:55:46
53岁王军霞公开力挺刘翔!奥运奖牌得主:刘翔应去当田径中心主任

53岁王军霞公开力挺刘翔!奥运奖牌得主:刘翔应去当田径中心主任

念洲
2026-08-29 06:57:16
旅行博主在玻利维亚补挂五星红旗 当事人:无论身处世界何地,每一位中华儿女都应尊重并维护国旗尊严

旅行博主在玻利维亚补挂五星红旗 当事人:无论身处世界何地,每一位中华儿女都应尊重并维护国旗尊严

封面新闻
2026-09-09 19:29:06
15999元!苹果发布的iPhone Duo,让全体果粉兴奋炸了

15999元!苹果发布的iPhone Duo,让全体果粉兴奋炸了

搞机小帝
2026-09-10 02:39:46
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
2026-09-10 20:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13961文章数 142731关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

大六座+千匹马力+71度大电池 阿维塔T09曝光/年内上市

态度原创

房产
本地
教育
时尚
公开课

房产要闻

别不服!海南的亿万富豪,只有不到300个!

本地新闻

拼假 13 天国内长线路线合集

教育要闻

一个视频看懂蝴蝶模型,巧求长方形面积!

秋天,穿风衣吧!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版