上周三晚上十一点半,客户对接人在企业微信连发三条语音。第一条就是老板刚开完会,通知那个Agent明天早上停掉。这个智能客服Agent花了将近50万,从立项到上线整整四个月,上线第一天日均处理量预期是2000单,第三天就掉到不足50单。运营投诉单像雪片一样飞过来,老板在周会上直接拍板关停。从上线到关停,整整一周。
模型不是背锅的那个
![]()
很多人第一反应是模型不行,或者国产模型不如GPT。刚开始我也这么想。后来把日志拉下来一条一条看,发现真不是。模型该会的都会,知识库内容都喂进去了,prompt调了七八版,Agent框架用的是市面上最主流的那一套,retrieval也接了向量数据库。技术栈没有任何明显硬伤,可它就是不能用。
幻觉在客服场景就是事故
这个客户做电商,Agent核心场景是售后咨询,最高频问题就是“我的退款到哪了”。正常逻辑是接到问题、调订单系统API、拿到退款单号和状态、回复用户。第一周翻车最严重的一条投诉:用户问“我昨天申请的退款到了吗”,Agent回复“您的退款单号RF20260518293847已于5月19日14:32退回原支付账户,请注意查收”。用户去支付宝翻了半天没找到这笔钱,人工客服一查,这个退款单号根本不存在。用户压根没成功提交退款申请,是Agent自己编了一个看起来无比真实的单号糊弄过去。
翻日志发现,工具调用那一步返回的是空结果,订单系统其实告诉Agent“没查到”,但Agent没有把“没查到”这个信号传递出来,而是自信满满地虚构了一个答案。类似情况一周内出了至少17次。在客服场景,一次幻觉就是一次投诉。闲聊场景幻觉是有趣,金融、客服、医疗场景里幻觉就是事故。做大模型评测的朋友说了一句话:现在所有号称解决了幻觉的方案,本质上都是在降低幻觉频率,而不是消除它。从5%降到0.5%,听起来很好,但客服一天进来一万个咨询,0.5%就是50起投诉。
延迟把体验全杀了
最早做POC的时候,我建议开thinking模式,因为退款查询涉及多步推理:识别用户意图、提取订单标识、调API、解析返回、组织自然语言回复。开了thinking准确率确实高一截。但上线之后,TTFT(首字延迟)稳定在3到5秒。用户在App里发一句“我的退款到了吗”,等了4秒钟屏幕一动不动,90%的用户会以为卡死了,直接点“转人工”。剩下10%等到回复了,第一句话还是“好的,我来帮您查询一下”,又过了两秒才出现真正内容。
试过关掉thinking,TTFT能压到800毫秒以内,但回答质量肉眼可见地暴跌,之前能拆出3步推理的问题,现在直接给个泛泛而谈的回答。甲方产品经理说了一句让我无言以对的话:“你们这个东西,要么慢得让人想砸手机,要么快得让人觉得在瞎说,没有中间档。”
上下文越聊越离谱
售后场景里多轮对话很常见,用户可能先问退款,问着问着扯到物流,再扯回订单,最后又问优惠券。Agent在前5轮表现都还行,从第6轮开始就慢慢糊涂了。最离谱的一个case:用户说“我上次买的那个订单怎么还没发货”,Agent回复“您查询的订单ORD20260512XXXX已于5月14日发货”。问题在于,用户说的“上次买的”指的是当前对话第2轮提到过的那个订单,但Agent调出来的是第8轮用户随口提到的另一个订单号。
理论上RAG应该按时间顺序和相关性排序,但实际上模型在token数累积到一定程度后,会出现明显的“近因偏好”——离当前最近的信息会被无差别地拉到前面,哪怕它跟当前问题关系不大。后来尝试做对话状态管理,把每一轮的关键实体(订单号、退款号、用户意图)显式存进结构化state里,每次让Agent显式从state里取。效果好了一些,但不是特别多。这个问题到现在也没想通到底该怎么彻底解决。
工具调用静默失败
Agent接了大概12个工具:订单查询、物流查询、退款发起、优惠券核销、商品详情等等。正常情况下,Agent调用、工具返回结果、Agent基于结果回答。但工具失败的方式有很多种:
- 网络超时
- 返回结果为空
- 返回结果格式异常
- 返回200但body是error message
理论上每一种异常都应该让Agent走到“抱歉,暂时查不到您的信息,需要我帮您转接人工吗”这条路径上。实际上日志统计,有大约23%的工具异常没有被Agent正确识别为“失败”,而是被它当成“模糊的输入”硬塞进了回答里。这部分现在认为是prompt工程的锅,没有把“失败信号优先级”提到足够高。但客户那边显然没耐心等我们慢慢调了。
为什么Demo阶段看起来都挺好
Demo本质上是一种受控环境下的展示。第一,Demo用的问题是精心准备的,提问者的措辞、上下文、节奏都是反复演练过的,跟真实用户那种又急又乱的口语完全是两回事。第二,Demo没有并发压力,一个一个问,模型表现得很从容。真实场景下高峰期一秒钟几十个请求,TTFT直接劣化到8秒以上。第三,也是最骚的一点,Demo的评估标准是“像不像人”,不是“对不对”。客户在Demo现场看Agent回答得文采飞扬会鼓掌,但在真实场景里,用户根本不在乎你回答得文采怎么样,只在乎你能不能解决问题。
现在跟客户做Demo的时候,会主动让他们随机出题,带方言、带错别字、带打断、带情绪。基本上每一次都能当场翻车。翻车不是坏事,翻在POC阶段,比翻在上线后强一万倍。
50万买来的实话
经过这次50万打水漂的事件,后来给所有问“要不要上Agent”的客户都说几句话。第一,别上全自动,先做“AI辅助人工”。让Agent把答案生成出来,但不直接发给用户,而是先发给人工客服审核一秒。这个建议不一定对,但确实是现在的真实想法。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.