网易首页 > 网易号 > 正文 申请入驻

AI Agent颠覆了端到端了吗?

0
分享至

这几个月,已经有些科技企业和主机厂试图用AI Agent(智能体)做自动驾驶,声称能规避端到端的弊端。当然,这些做法也没大声嚷嚷。一个是监管因素,另一个可能是AI Agent才刚刚起步。

端到端的长尾能力,为什么不行

经过一年多的商业化落地,端到端+VLM(视觉语言大模型)在长尾场景中表现不如期待,背后的原因是决策短视。在中我们曾经讨论过,端到端往往以单帧画面、单步动向作为决策依据,缺乏对未来数秒内连贯的规划能力,没有形成“策略序列”。这一点上不如人类。其实无须长尾,就一个简单的左转,端到端也是只考虑下一秒动作,没有完整的通过路口的规划。之所以实际动作看上去还算连贯,是由多个“下一秒动作”串起来。一旦中间出岔子,需要改变计划的时候,系统就缺乏应变能力。

背后还有一个原因,就是端到端的感知是被动的。模型训练阶段就固定接收低维度文本指令(如速度、导航信息)和完整视觉信息。对图像的关键细节缺乏关注,形成视觉忽视。到底什么才被认定为“关键细节”,是人类驾驶的核心技能。


比如等待左转的经典场景:左转灯刚亮,右侧人行横道远端晃过一团影子。电光火石间,人马上就察觉到存在两个不合理之处:一个是人行横道方向正处于红灯,另一个即便在人行道上,这个速度也绝对不是行人。只有注意到“异常”,才会及时刹车。多半是外卖电动车顺人行横道闯红灯抢行。

如果只注重信号灯、交通规则和前一秒的画面,就不会有制动决策。端到端的无依托左转向来有问题,就是因为处理不了这种复杂场景。

对于不确定又很关键的视觉信息,人类司机的处理方式,通常都是“再看一眼”或“凑近点看”。如果情况紧急则采取保守策略。

显然,人类应对长尾的行为,包含了策略序列和主动感知两个重要能力。

世界模型的合成数据,两种大模型训练效果不同

有些企业就想用AI Agent的方式来解决解决长尾问题。在线互动上,智能体已经获得广泛应用。想想打银行客服电话,对面是谁接起电话。智能体不止能当客服和电子助手,在线教学、客户专业支持、数据库助手……看上去智能体似乎更胜任与人类互动。在车端,智能体也首先用于座舱互动。

将其作为聊天助手,其引擎通常就是LLM(大语言模型)。如果搭建VLA(语言-视觉-行为大模型),即从思考范式上成为一个驾驶智能体(模拟司机),是不是能够更好地解决长尾问题,让智驾具备L3能力呢。

两者都需要大模型训练、蒸馏和车端转移小模型。不过,两者区别几乎体现在所有环节。端到端为了应对长尾,需要大量实车数据。世界模型生成的合成数据,用于端到端训练效果不好。


简单说,合成数据可以扩充样本,但是没办法解决“零样本泛化”的问题。比如我们用各种“鬼探头”合成数据训练端到端大模型,感觉练得也挺好的,结果一上路,碰到一辆驴车,又懵了。长尾是无穷无尽的,非结构性场景最好由认知推动,由数据推动的端到端训练效果不理想。模拟考经常得高分,一上正式考场就考砸。

Agent可以玩命用世界模型训练。合成环境对现实物理模拟很粗糙,但Agent可以通过视觉轨迹奖励,优化决策。与端到端的被动视觉不同,Agent通过多次主动视觉-动作的反馈,探索合理策略。这和人思维模式很像了,面对陌生场景,用保守方法(低速跟前车,随时改变策略)试错。而不是像端到端那样的内部黑箱。

看和听的能力

主动视觉有两个特征,一个是“对齐”,另一个是自动调整权重。调权重很容易理解,在雨雪雾天气里面,激光雷达和摄像头都会受到强干扰,而且这些干扰很难用滤波手段去除。这个时候,如果降低摄像头感知权重,提升毫米波雷达权重,将减少误判。人也是如此,黑暗的环境下,人虽然不能像蝙蝠那样发出超声波探路,但不由自主“竖起耳朵”专注于声音,同时降低视觉敏感度。

而“对齐”也是人类的核心技能。面对一幅画面或者动态图,如果有人说,找找画面里面的“半个苹果”,你还会关注每个细节吗?显然不,你只会快速扫描整幅图,去找那个符合语言特征的玩意。顺便说一句,驾驶当中,交通标志标线、各种画面、人类口语,都是“大语言”。

这就是语言和图像的“对齐”。一句话一般只与画面中特定细节对应。如果提供一个长文本,任何受过基础教育的人,也是迅速找到与图画描述有关的词句。然后和画面特定位置建立映射。Agent也具有这个能力,即建立了跨模态语义匹配与融合能力。


一辆车如果由AI Agent驾驶,人可以随时发号施令:“跟住前面第二辆红车,别管眼前这辆白的”。系统自己会选择“一组”合理策略执行这道模糊的命令。

想做到这一点,需要完成视觉语言的基座训练(主要练“对齐”),思维-动作后训练(其中关键是扩散模型,持续预测轨迹和环境,以便调整),强化训练(包含刚才说的奖励模型)。这些训练完成之后,能在车端运行的AI Agent也就有了。

内化规则

和端到端需要另加规则兜底不同,AI Agent可以内化规则,就通过奖励函数学习的方式。比如让行救护车、消防车等,Agent计算“让行代价=延误时间×急迫系数”、“不让行风险=事故概率×伤亡可能性”等量化规则,而非依赖一堆条件语句。

AI Agent的核心突破在于,分层推理将数据转化为可交互的知识,其训练过程更接近人类驾驶员的经验积累模式——在理解规则的基础上通过实践优化策略。也因为同样原因,人可以与AI Agent互动,参与驾驶。这是“人机共驾”的高级阶段,不是通过控制权交接,而是用语言就能互动和干预。

语言映射和决策-行为多次反馈机制,与人开车的方式也很类似。与端到端相比,强学习的AI Agent更像人,其推理结果和行为模式都可以验证和反推,与端到端不同。

两者暂时各擅胜场

说了这么多AI Agent的优点,是不是说它可以一脚将端到端踢开,成为智驾主流?AI Agent有个很大的缺点——决策时间长,都是秒级的。对于一些紧急情况,显然不行。因此有些企业试图让端到端主导99%的L2场景,即轻量化思考;只有1%左右的长尾场景,由AI Agent来完成复杂博弈。后者的思维链也不能太长,最多三四层。再长的话人受不了,就像临门一脚思考人生一样诡异。

当然这是实验性质的。两种架构融合在一起,才有商业化部署的价值(比如云端协同)。如果能为世界模型开发出高保真物理引擎,强化学习可能训练出同时具备精准控制和复杂博弈能力的时敏型驾驶模型。

这需要解决三个问题:逻辑链的实时性瓶颈、神经符号系统保障决策的可解释性、跨场景认知迁移机制。

当前条件下,端到端方案仍是L2量产的最优解。虽然没摸到其能力边界,但有能力登上L3高台阶的,大概率是AI Agent,只要解决其思考时长问题。而复杂泊车等非时敏型场景,现在AI Agent就已经解决得很好。


自动驾驶的核心矛盾,一直都是无限场景空间与有限训练资源的对抗。端到端方案更倾向于通过实车数据提升数据利用效率,AI Agent则通过决策范式以降低数据依赖。两者关系如同内燃机与电动机——短期并存满足不同场景需求,长期催生融合新架构。或者还有一种可能,就是其中一种解决自身瓶颈,从而取代对方。看长期的话,AI Agent更有希望做到这一点。

注:图片部分来源网络,如有侵权,联系删除。

“消失的前车”透露了智驾哪方面缺陷?

克服AI幻觉?也许在开智驾倒车

2025过半,整车市场终局的端倪

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
沈志栋,任苏州市政府副市长!国税总局福州市税务局局长王哲林,拟履新!

沈志栋,任苏州市政府副市长!国税总局福州市税务局局长王哲林,拟履新!

王姐懒人家常菜
2026-09-05 08:10:56
女篮世界杯最惨东道主出炉!揭幕战狂输30分:避开中国队却避不开惨败?

女篮世界杯最惨东道主出炉!揭幕战狂输30分:避开中国队却避不开惨败?

篮球快餐车
2026-09-05 02:23:28
吴三桂被满门抄斩,次子侥幸逃脱,与陈圆圆隐居,现在后代超千人

吴三桂被满门抄斩,次子侥幸逃脱,与陈圆圆隐居,现在后代超千人

千秋历史
2026-03-17 22:10:11
中国女篮惨败美国仅1天,不对劲的一幕出现,李月汝、李梦被牵连

中国女篮惨败美国仅1天,不对劲的一幕出现,李月汝、李梦被牵连

潋滟晴方DAY
2026-09-05 17:34:56
央视直播中国女篮生死战,开球时间确定,宫鲁鸣输不起,王思雨得复出

央视直播中国女篮生死战,开球时间确定,宫鲁鸣输不起,王思雨得复出

体育大学僧
2026-09-05 09:31:11
克拉克谈张子宇:从没和这么高的球员打过,她给我们带来挑战

克拉克谈张子宇:从没和这么高的球员打过,她给我们带来挑战

懂球帝
2026-09-04 23:40:10
德国工业界要求每周工时从35小时恢复到40小时!10月将迎劳资谈判决战

德国工业界要求每周工时从35小时恢复到40小时!10月将迎劳资谈判决战

红星新闻
2026-09-04 18:13:36
特朗普版1美元硬币开卖数小时就被一抢而空;硬币不含黄金,印有醒目的“250”与特朗普头像

特朗普版1美元硬币开卖数小时就被一抢而空;硬币不含黄金,印有醒目的“250”与特朗普头像

第一财经资讯
2026-09-03 13:00:44
OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题

OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题

快科技
2026-09-05 13:16:05
当大规模裁员事件发生时:工会在做什么?

当大规模裁员事件发生时:工会在做什么?

生命可以承受之轻
2026-09-03 06:45:32
穆里尼奥看走眼!皇马绝对核心灾难拉胯!全场隐身成输球头号罪人

穆里尼奥看走眼!皇马绝对核心灾难拉胯!全场隐身成输球头号罪人

澜归序
2026-09-05 08:17:21
千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

夜深爱杂谈
2026-08-29 21:36:29
当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

户外阿毽
2026-09-05 12:14:10
记者:海港俱乐部为国安远征军提供免费绿豆汤

记者:海港俱乐部为国安远征军提供免费绿豆汤

懂球帝
2026-09-05 18:53:18
男人一天最多能几次?别盲目逞强!医生曝出透支上限,多数人都超了

男人一天最多能几次?别盲目逞强!医生曝出透支上限,多数人都超了

荔子言
2026-08-26 15:20:06
回顾:上海杀妻案朱晓东被处死刑,狱中对妻子的评价,让人胆寒

回顾:上海杀妻案朱晓东被处死刑,狱中对妻子的评价,让人胆寒

墨策讲历史
2026-09-04 17:15:28
女子被指发布45秒拼接视频,犯寻衅滋事罪被判1年8个月,撤诉后获43.56万国家赔偿,涉事法院尚未对其恢复名誉

女子被指发布45秒拼接视频,犯寻衅滋事罪被判1年8个月,撤诉后获43.56万国家赔偿,涉事法院尚未对其恢复名誉

大风新闻
2026-09-04 21:08:03
恩里克:输球的教练就不该接受采访;足球有时候就是无法解释

恩里克:输球的教练就不该接受采访;足球有时候就是无法解释

懂球帝
2026-09-05 06:10:08
半导体巨头,拟大手笔扩产!

半导体巨头,拟大手笔扩产!

证券时报
2026-09-05 13:26:03
机关事业单位大量清退编外人员,这5类人将被清退,熬不到退休了

机关事业单位大量清退编外人员,这5类人将被清退,熬不到退休了

职场资深秘书
2026-09-05 11:07:06
2026-09-05 19:44:49
新浪汽车出品 incentive-icons
新浪汽车出品
一家有理想的汽车媒体
4150文章数 1162关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

健康
手机
数码
家居
公开课

脑梗取栓成功≠活下来,还有这三关

手机要闻

台风沙德尔来袭!小米宣布提供小米手机数码/家电免费维修:范围公布

数码要闻

IFA2026现场直击:绿联双馆齐发,AI全家桶抢占C位

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版