全球顶级AI学术会议IJCAI-ECAI 2026的官方竞赛里,一支由中国高校和企业组成的队伍,在车载语音助手赛道拿下了开放赛道第一名,还顺手捧走了两项大奖。这支名为Darwin Agent的团队,由小米联合南京大学、清华大学的研究者组成,他们自研的TRACE方法,以70%的稳定通过率击败了包括宝马集团、英国阿兰·图灵研究所等机构在内的多支队伍。
比赛结果公布时,很多人第一反应是:车载语音助手这种"老话题",还能玩出什么新花样?但仔细看比赛规则会发现,这次考的根本不是"谁更会聊天",而是"谁更靠谱"——同一个任务重复做三遍,看你是不是每次都能做对。
![]()
车载智能体,难的不是"会做"而是"稳"
随着大模型和智能终端的发展,语音助手正从简单的指令执行工具,变成能理解场景、调用工具、自主决策的智能体。但在智能汽车加速普及的今天,车载语音助手真正难的,从来不只是"能不能把事情做完",而是能不能在复杂、模糊甚至能力受限的情况下,依然做出正确且稳妥的判断。
举个比赛里的例子:夜间驾驶时,用户说"请帮我打开车灯",如果语音助手没识别车辆当前灯光状态,也没确认用户要的是哪种灯,直接开了近光灯就回复"已完成",结果可能跟用户真实意图对不上。这种未经确认的直接执行,不仅影响交互体验,还会增加驾驶中的信息核验负担。更严重的是,智能体在信息不足时贸然决策,甚至可能带来安全风险。
这正是CAR-bench Challenge想回答的问题:当智能体遇到做不到、判断不准的情况时,它该怎么应对,才算真正靠谱?
58个真实工具,三类考题专治"装懂"
为了把这个问题考清楚,CAR-bench搭了一个完整的车载座舱模拟环境,里面装了58个真实可调用的工具——导航、车窗、空调、充电、日程一应俱全。比赛分两个赛道:受限赛道只能用指定模型和有限算力;开放赛道则可以自由挑选模型和系统架构,重点考察前沿模型的能力上限和真实部署的稳定性。两个赛道都把"同一个任务重复做三遍、看是不是每次都对"作为核心评分依据。
围绕这个"稳"字,比赛设了三类考题:
- 基础题:指令明确,看智能体能不能按部就班把事做完;
- "明知做不到"的题:故意拿掉完成任务所需的工具,看它是硬着头皮编造调用和结果、假装大功告成,还是老实承认"这个我做不了";
- "指令模糊"的题:给一条说不清的指令,看它是直接猜一个结果,还是查清楚用户的真实意图。
这三类题,分别考的是智能体能不能做、知不知道自己做不到、会不会在听不懂时先查清楚——恰恰是车载语音助手走向真实部署必须迈过去的坎。
TRACE的三步法:把经验拆成积木,按需取用
面对这三类考题,团队提出了一套叫TRACE(基于轨迹对比的智能体进化)的方法。它的核心思路可以概括成三步。
第一步,把经验拆解为可复用的具体动作,而不是形成大而全的任务攻略。传统方法通常会把经验总结成一套宽泛的任务攻略,但这类攻略往往难以迁移到其他场景。TRACE会先拆解任务目标,把经验细化为一个个具体且可重复使用的操作,比如"打开车窗""打开风扇",而不是"车内闷了怎么办"这样的一整套方案。这样一来,同一项具体操作就能在导航、空调、媒体等不同任务中被复用。
第二步,通过对比正确与错误的执行过程定位问题,而不是仅依据整体结果判断。只看任务最终是否完成,往往难以发现具体是哪一步出了问题。TRACE会对比同类任务中执行正确和执行错误的过程,定位导致失败的具体原因——是在信息不足时直接执行,还是遗漏了关键规则,又或者是错误声称具备实际不具备的能力。随后,系统把这些分析结果沉淀到经验库中,持续优化。
第三步,根据对话现场按需取用经验,而不是一股脑全塞给模型。每一轮对话,系统都跟着用户当下的需求,只把真正用得上的经验和规则挑出来,需求一变,取用的经验也跟着变。这样既省算力,也让智能体的反应更贴合当下情境。
不重新训练模型,靠"经验库"越用越准
最关键的是,这套方法不需要重新训练模型、也不用改动模型本身,相当于给现成的模型配上了一个会越用越准的经验库。每一次做对,它就把正确做法沉淀成"指导经验";每一次做错,它就把教训沉淀成"犯错经验"。等新的对话一来,再按当前需要把相关经验取出来用,让车载智能体面对新场景也心里有数。
数据上,TRACE在三次执行中至少有一次正确完成任务的比例约83%;更重要的是,三次均成功完成的稳定通过率达到70%。相比官方参照方案50%的稳定通过率,TRACE提升了20个百分点,最终以70%的成绩拿下开放赛道第一名,同时斩获Rank Award(排名奖)与Innovation Award(创新奖)两项大奖。
从竞赛到真实场景,可靠智能体再进一步
这次比赛真正验证出来的,其实就是三件事:能不能稳定完成任务、能不能在做不到时如实说明、能不能在信息不全时先问清楚再动手。这三件事,恰恰是语音助手、乃至更广泛的人车家全生态里各类智能体场景最需要的能力。
比如,用户在车里随口说一句"有点闷",系统是该直接把车窗降下来,还是先看一眼车速、车外温度、是不是在下雨,再决定是该开窗还是开空调?用户说"导航去公司",可地址簿里存着好几个公司地址,系统是该随便挑一个,还是先跟用户确认一下到底去哪个?
这些看似简单的交互,实际考验的是智能体对环境状态、用户意图和自身能力边界的综合判断。相比"能不能完成任务",真实场景更关注的是能否持续、稳定、准确地完成任务,并在信息不足或能力受限时做出合理响应。
对于小米而言,这类能力与智能座舱、小爱同学及"人车家全生态"中的智能交互场景具有一定关联。TRACE在经验沉淀、动态调用和稳定执行方面的探索,也为后续智能体在真实场景中的可靠性研究提供了新的思路。技术的价值,最终要落到真实的产品体验中——这次竞赛成绩,是对TRACE方法的一次验证,也是小米在智能体可靠性方向上的一次探索。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.