![]()
2026年,如果你问一个AI大模型:"图片里这栋楼是什么建筑?"它十有八九能答对。你再问它:"从这里出发,走到中环码头怎么走?"它可能还是能给你说出个大概方向。
但如果你把它放进一个真实的、按1:1还原的香港街道里,让它自己走过去呢?
结果可能会让你大跌眼镜。上海交大、新加坡国立大学、美团等机构联合做的一项研究发现,几乎所有主流大模型在这种真实场景下的长距离导航成功率,都逼近于零。
这不是危言耸听。这篇论文的名字叫《UrbanGround》,讲的就是这样一件事:AI认路的能力,和AI"走"路的能力,中间隔着一道几乎所有人都低估了的鸿沟。
这道鸿沟有多深,我们慢慢聊。
先说说这件事为什么突然变得重要。这两年多模态大模型(MLLM,能同时理解图像和文字的AI模型,比如GPT、Gemini这类既能看图又能对话的系统)发展得飞快,随便拿张街景照片给它看,它能准确说出这是什么店、什么建筑、周围有什么设施。这种"看图说话"的能力已经相当成熟了。
但研究团队敏锐地意识到一个问题:现实世界里,人从来不是"看一张照片就完事"的。你走在街上,每往前迈一步,眼前的画面就会变。刚才路口那个熟悉的地标,转个弯可能就消失在视野外了,但它的位置信息其实还有用,你得靠脑子里的一张"心理地图"把它记住。
这就好比你去一个陌生城市旅游,导游先给你看了张地图,指着说"我们现在在这里,博物馆在那里"。这时候你能准确回答"博物馆在我左前方大概200米",这叫读图能力。但如果导游转身走了,你自己得沿着弯弯曲曲的巷子走过去,中间要过马路、上天桥、绕开施工围栏,这时候光会读图就不够用了,你得一直在心里维持"我现在在哪、目标在哪个方向、我走过的路对不对"这套动态判断。如果你每走三步就把之前的方向感忘光,那哪怕你一开始读图读得再准,也照样走丢。
研究团队要问的正是这个问题:AI模型的"读图能力",能不能撑得起"走路能力"?
造一座能走进去的香港
要回答这个问题,研究团队做了件挺硬核的事:他们没有用游戏里虚构的城市,也没有满足于航拍图或者街景照片拼接,而是直接拿香港特区政府地政总署公开发布的真实地理数据,在Unity游戏引擎里1:1还原了一整座可以物理行走的香港城市。
这个数字孪生城市叫UrbanGround。
数字孪生*:用真实世界的数据(比如地图、建筑模型)在电脑里还原出一个几乎一模一样的虚拟版本,虚拟世界里的坐标、建筑、道路和真实世界严格对应。
它用了两套官方数据:一套是"3D可视化地图",通过航拍影像重建出来的城市三维网格模型,覆盖香港全境的建筑和地形;另一套是"3D行人网络",记录了香港所有人行道、天桥、隧道之间的真实连接关系。前者负责让这座城市"看起来是真的",后者负责让这座城市"走起来是对的"。
这两套数据被导入Unity引擎后,AI智能体(也就是被测试的大模型)就能像一个第一人称游戏角色一样,在里面移动、转身、跳跃、开地图。整个环境还支持切换白天黑夜、晴天雨天,甚至可以让马路突然施工封路,或者让街上突然冒出一堆会动的行人。
如果不这样搭建,会发生什么?之前的研究要么用游戏引擎里凭空捏造的虚拟城市(比如Minecraft式的方块世界),场景规则是游戏自己定的,跟真实城市的复杂度完全不是一回事;要么用航拍图或街景照片拼接的方式,让AI在几张照片之间"跳来跳去",这种跳跃式的移动根本没有物理连续性,你在真实世界里走路是一步一步挪的,不是"啪"一下从A地传送到B地。前者规则脱离现实,后者动作脱离物理连续性,两种做法都没法真正检验AI能不能把"看懂一张图"变成"完成一段真实的行走"。
这就好比你想测试一个人到底会不会开手动挡汽车。如果你只给他一个方向盘模型让他"想象"打方向,或者干脆放一段别人开车的视频剪辑让他"选择接下来该踩哪个踏板",这都测不出真本事。你得让他坐进一辆真车里,手脚并用地上路。UrbanGround干的就是这件事:给AI一辆能开的"真车"。
三个问题,层层递进
研究团队没有一上来就让AI去完成复杂任务,而是设计了一套"五级难度阶梯",一层层加码,分别对应三个研究问题。
**第一个问题:AI能不能在原地把周围环境看明白?**
这一级测试的是最基础的能力:视觉识别(能不能认出眼前的建筑、店铺是什么)、方向理解(能不能判断某个地标在自己的左边还是右边)、主动探索(答案不在眼前,得走几步找证据再回答)。
结果挺让人意外的。视觉识别这一项,大部分模型表现相当不错,Claude-Opus-5能达到91.3%的准确率,Gemini-3.6-Flash更是高达93.8%。这说明AI"看懂"街景真的没问题。
但一旦问题涉及方向判断,表现直接跳水。GPT-5.4只有31.7%的准确率,这个数字已经接近瞎猜的水平(四选一的题目,随机蒙对的概率是25%)。就连表现最好的Claude-Opus-5,方向题准确率也只有58.3%,比它自己在视觉识别上的91.3%整整低了33个百分点。
这个反差挺关键的。这说明AI能认出"这是一栋大厦",但没法建立起"这栋大厦在我面前偏左还是偏右"这种稳定的空间参照系。用大白话讲就是,AI记得住"看见了什么",但记不住"看见的东西在哪个方向"。
这就好比你去一家新餐厅吃饭,服务员领你绕了几圈才坐下。吃完饭出来找厕所,你能准确说出"刚才进门时看到一个鱼缸",但你完全说不清那个鱼缸此刻在你身后的哪个方位。你记住了"内容",却没记住"内容和你自己的相对位置关系"。如果一个人连这点空间感都建立不起来,那他别说独自走回停车场了,可能连往哪个方向迈第一步都拿不准。
还有个细节值得说一说:研究团队专门测量了一个叫"人行道遵从率"(PNA)的指标,就是看AI走的路线有多少时间是踩在真实的人行道系统上,而不是横穿马路或者穿墙走私人地界。结果发现,即便AI答对了问题,比如成功找到了"北京同仁堂旁边是哪家银行",它为了图快,经常直接横穿马路,压根不走斑马线。
论文里给了个GPT-5.5的具体例子:它成功定位了药店和旁边的银行,答对了"东亚银行",但为了尽快完成任务,直接横穿马路,脱离了登记在案的人行道系统。这说明一件挺现实的事:AI知道答案在哪,但它对"怎么合规地走过去"这件事,压根没往心里去。
**第二个问题:这种局部认知能不能撑起真正的导航?**
这才是研究的重头戏。研究团队设计了8种越来越难的导航任务,包括目的地明确的短距离导航、长距离导航、按指令一步步走的导航,还有得自己推测目的地在哪的隐含意图导航。
短距离导航这一项,如果目的地就在视线范围内,好几个模型都能有不错的成功率,GPT-5.5和Claude-Opus-4.6都达到了75%。这说明"看得见目标、走过去"这件事,AI是能做到的。
但只要把距离拉长,把目的地挪到看不见的地方,长距离导航的成功率几乎所有模型都跌到了个位数,甚至0%。GPT-5.5的长距离导航成功率是0%,GPT-5.4是1.3%,就连表现最好的Kimi-K3也只有3.8%。
这个数字对比特别扎眼:同样是"从A走到B",只不过距离长了几个街区,成功率就从75%崩到接近0。
研究团队专门指出了一件很反直觉的事:理论上讲,一段长路完全可以拆成好几段短路来走。既然AI能搞定单个短距离导航,那把长路拆成几个短路依次完成,不就该能走通吗?
但现实是不行。研究团队分析发现,问题不在于AI走不出第一步,而在于**AI没法把短距离的能力"串联"成一段完整的长距离行为**,走着走着方向就跑偏了,而且一旦跑偏,它没有能力把自己"拉回正轨",错误会一直累积下去,最后彻底迷路。
这就好比你让一个刚学会认路的孩子去楼下便利店买瓶水,他能做到,来回也没问题。但你让他从家里走到三公里外的姑姑家,即使你告诉他"先往南走两个路口,再往东走一个路口,再往南……"这种分段指令,他大概率还是会在中途某个路口走错方向。原因不是他不会走路,也不是他记不住指令内容,而是他没法在走了十几分钟、看到的场景全变了之后,还持续记得自己刚才是往哪个方向拐的、现在应该往哪个方向拐。这种"跨越时间和场景变化的方向持续性",恰恰是长距离导航最难的地方,而它偏偏不是靠单次识别能力能解决的。
研究团队还做了个很细致的补充分析。他们发现虽然长距离导航的"完全成功率"接近0,但超过50%的失败案例里,AI最终停留的位置其实比出发点更接近目标了,也就是说AI有在往正确方向努力,只是没能坚持到底。论文里配了两张GPT-5.5的实际探索截图,非常说明问题:一次是它遇到障碍后成功找到官方天桥绕行,稳步走近目标;另一次是它试图抄近路横穿马路,结果被路中间的障碍物挡住,然后就在原地反复重复"往前冲"这个动作,完全没有意识到该换条路走。同一个模型,前一秒还表现出不错的空间推理能力,后一秒就卡在一个障碍物前死循环。这恰恰印证了论文的核心发现:局部能力和持续行为之间,隔着一道真实存在的鸿沟。
**第三个问题:城市变了,AI还能跟上吗?**
最后一个层级测试的是"环境变化后AI的应对能力"。研究团队设计了两类动态场景:一是导航过程中突然告诉AI"前方道路封闭了";二是往人行道上撒一批会移动的虚拟行人(用微软开源的Rocketbox虚拟人模型),看AI能不能一边导航一边避让。
道路封闭这个场景的结果尤其扎心。研究团队用"安全推进率"(SPR)这个指标衡量AI在得知封路消息后,有多少比例的情况下真的绕开了封闭路段并继续朝目标前进。结果显示,绝大多数模型的SPR都低于20%,GPT-5.5只有13.3%,Doubao-Seed-2.0-Pro只有10%。
但与此同时,这些模型的"人行道遵从率"(PNA)却普遍在93%以上,全都是高分。这个反差揭示了一件很微妙的事情:AI依然在乖乖地走在人行道上,动作看起来完全正常、完全合规,但它的整体路线规划已经彻底失效了。用论文里的话说,这叫"局部合规的移动,但缺乏有效的整体调整"。
这就好比一个人开车导航时突然被告知前方施工封路,他确实老老实实地没有违规逆行、没有闯红灯,方向盘打得也很稳,但他压根没有重新规划路线,还是稀里糊涂地朝着原来那条已经走不通的路继续开。表面上看,他每个瞬间的驾驶动作都无可挑剔,可整体上他哪儿也到不了。这说明"守规矩"和"能达成目标",其实是两件完全不同的事情,前者是执行层面的谨慎,后者需要更高层的判断和重新计算。如果只满足于前者而忽视后者,看起来一切正常,实际上已经彻底偏离了任务本身。
行人避让的场景也不乐观。几乎所有模型的"行人碰撞率"(PCR)都在76%到90%之间,这意味着绝大多数时候,AI智能体在导航过程中都会撞上虚拟行人。这说明留在人行道上不代表AI具备了"避让移动物体"这种基本的场景感知能力。
光照和天气也在悄悄拖后腿
除了封路和行人,研究团队还测试了天气和光照变化对AI表现的影响。他们让AI在同一个地点、同一个任务下,分别体验晴天、多云、下雨、黄昏、夜晚这几种不同条件。
结果显示,光照变差(比如从大白天变成黄昏或夜晚)会明显拉低AI回答问题的准确率。GPT-5.4在晴天时问答准确率是56.8%,到了黄昏直接掉到44.6%,跌了12个百分点。这个规律不难理解,光线暗了,招牌看不清、店铺细节模糊,AI自然更难判断。
但有意思的是,这种"视觉变差导致答题变差"的规律,在导航任务上却并不成立。研究团队发现,天气和时间对短距离导航成功率的影响,没有一致的规律,有些模型在雨天反而表现更好,这说明导航失败的原因主要不是"看不清",而是路线规划和执行本身出了问题,跟视觉清晰度关系不大。
还有个特别反直觉的发现:虽然夜晚的能见度理论上比黄昏更差,但大部分模型在黄昏时段的表现反而比夜晚更差。研究团队猜测,这可能是因为黄昏时分那种橙红色的天光和逐渐亮起的路灯混在一起,造成了某种视觉干扰,这种介于"看得清"和"看不清"之间的模糊地带,反而比彻底天黑更让AI犯迷糊。这个发现挺有意思的,说明AI对光照的敏感程度,跟人类的直觉判断不完全一致。
表格里藏着的规律
研究团队一共测试了10个主流大模型,包括GPT-5.5、GPT-5.4、GPT-5.2、Claude-Opus-5、Claude-Opus-4.6、Gemini-3.6-Flash、Gemini-3.1-Pro、Doubao-Seed-2.0-Pro、GLM-5V-Turbo和Kimi-K3。
有个规律特别值得说一说:在简单的局部问答任务上,各家模型的差距并不算特别悬殊,大家都在60%到90%这个区间里浮动。但一旦切换到需要持续导航的任务,模型之间的差距突然被放大了。就连同属GPT家族的GPT-5.5和GPT-5.4,在短距离导航上一个是75%,另一个只有15%,差了整整60个百分点。
这个现象背后的逻辑其实很好理解:问答任务只需要模型判断"对一次",而导航任务需要模型在几十个连续动作里"每一步都不出大错"。哪怕单步犯错的概率只有5%,走上30步之后,全程不出错的概率也会跌到只剩21%左右。这就是所谓的误差累积效应,一步一步的小偏差,攒到最后就是彻底走丢。
也正因为如此,导航任务才成了检验AI"真实空间智能"的一块试金石,它比单纯的问答测试严苛得多,也诚实得多。
写在后面
读完这篇论文,我最意外的一点其实不是"AI导航能力差"这个结论本身,这多少能猜到一些。真正让我意外的是那个"人行道遵从率"和"任务成功率"的巨大反差。
一个AI可以一边规规矩矩地走在人行道上,一边彻底迷失方向,完全不知道自己在往哪走。这种"看起来很守规矩,实际上完全失效"的状态,某种程度上比"直接犯错"更让人不安,因为它意味着表面的合规性根本不能作为判断系统是否可靠的依据。
这让我联想到一件不完全相关但结构类似的事:很多组织里的执行流程也是这样,每个人都按流程办事,每个环节都合规,但整个组织的方向可能早就跑偏了,而且没人会因为"流程正确"就停下来质疑方向本身。UrbanGround这篇论文用一座虚拟香港,把这个抽象的道理变成了可以量化、可以复现的实验数据。
论文里那两张GPT-5.5探索截图的对比也让我反复琢磨了很久,同一个模型,同一次任务里,前几十步表现得像模像样,走天桥、绕障碍,几乎无可挑剔;后几十步却在同一个障碍物前死循环冲撞。这种"能力时有时无"的不稳定性,或许才是当前大模型最难被量化、也最容易被低估的短板。
论文还没解决的一个问题是:如果AI真的在某一步"迷路"了,它有没有可能主动意识到"我好像走错了",然后回头去重新确认自己的位置?目前看来,答案是否定的,大多数模型一旦偏离轨道,就会在错误的方向上一条道走到黑。这种"自我纠错"的能力,会不会是下一代空间智能研究真正该攻克的方向?
Q&A
Q1:UrbanGround是什么?
A:UrbanGround是由上海交大、新加坡国立大学、美团等机构联合打造的真实尺度城市沙盒,基于香港地政总署公开的真实三维地理数据构建,支持多模态大模型以第一人称视角在其中真实行走、导航和探索,用于测试AI的空间认知与行动能力。
Q2:为什么AI认路能力测试这么难做?
A:因为真实城市导航需要AI在移动过程中持续维持方位判断,而不只是识别单张图片。此前的测试环境要么是虚构游戏世界规则脱离现实,要么用照片拼接方式让AI"跳跃式"移动缺乏物理连续性,都无法真实检验AI能否把局部认知转化为持续行为。
Q3:测试发现AI导航最大的问题是什么?
A:研究发现AI的局部认知能力(如识别建筑、短距离导航)表现不错,但无法把这些能力串联成长距离的持续导航行为,误差会不断累积且难以自我纠正,同时在道路封闭、行人移动等环境变化下,AI常常"看起来合规"却完全偏离了正确路线。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.