把四个当前最能打的模型放进同一个游戏世界,让它们组队打怪、采集、造装备,结果最好的那支队伍,只完成了52.0%的任务。
这不是某个模型单挑输了,而是团队协作这件事本身,还没及格。OpenAgents、哥伦比亚大学、宾夕法尼亚大学、首尔大学和宾夕法尼亚州立大学的研究者一起搭了个叫 AgentWorld 的评测基准,专门测多智能体协作。测出来的数字,比想象中扎眼。
![]()
一个魔法杖,卡住一整支队伍
任务听起来简单:给队伍里的法师做一根魔法杖。伐木工砍木材,木工把木材加工成木棒,法师拿木棒加上自己手里的材料完成制作。
各司其职就行?真跑起来,问题出在每一次交接上。木材该交给谁,木棒准备好了没有,队友做完的步骤要不要重复做,任务还没完成有没有人提前喊收工。这些细节,才是多智能体系统真正要过的关。
AgentWorld 把这类任务放进一个 MMORPG 沙盒里。有可采集的资源、可制作的物品、需要应对的敌人,还有分布在不同位置的队友。一个智能体的行动会改变环境,也会影响其他成员下一步能做什么。
论文介绍的任务集由 100 个人工设计任务和 100 个增强变体组成,覆盖战斗、制作、采集、交易、探索、生存、建造和协调等类型。任务需要 3 至 20 个智能体参与,很多任务包含连续的资源交接和行动依赖。
协作在这里不是一段听起来合理的对话,而是一串必须真正发生的动作。
三个设计,把协作难题逼出来
第一个是角色不对称。不同智能体拥有不同技能、物品和初始条件,队伍得根据差异安排工作,而不是让所有人执行同一套动作。魔法杖任务里,伐木、加工、制作形成一条依赖链,就算每个成员都知道最终目标,团队仍要解决谁先做、交给谁、什么时候交。
第二个是黑盒交互。智能体不能直接读取队友的内部推理状态,只能通过环境观察、聊天和行动结果判断别人在做什么。「我以为队友已经做完了」,成了真实的失败来源。
第三个是多轮执行。一份开局计划覆盖不了所有后续变化,队伍必须在执行中持续更新状态:资源是否到位、队友是否需要支援、原先的分工是否还有效。主任务设置了数十轮的执行预算,要求智能体在多次交接中保持协调。
为了减少低层操作的干扰,AgentWorld 提供了 13 个高层 API 工具。采集或攻击工具可以封装导航和具体执行流程,让模型把更多决策放在下一步做什么、和谁配合上。
聊天最多那支队伍,成功率不是最高
研究在统一的提示模板、工具定义和交互协议下,评测了 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B。
主任务集上,四个模型的任务成功率分别是 52.0%、45.0%、36.0% 和 20.0%。增强任务集上,对应成功率为 24.0%、26.0%、21.0% 和 10.0%。
还有一组数字值得单独看:Gemini 3 Flash 在主任务集上的部分成功率为 71.5%,完整任务成功率是 52.0%。团队推进了一些中间目标,并不保证最后的资源交接或制作步骤能完成。
通信量和成功率之间,也没有「越多越好」的简单关系。GPT-5 Mini 平均每个主任务发送 44.1 条聊天消息,成功率 36.0%;Gemini 3 Flash 平均发送 11.0 条,成功率 52.0%。
这组结果不能证明少聊天会提升成功率,但它提醒了一件事:消息数量替代不了协作质量。更该关注的是,一条消息有没有更新有效信息,有没有消除分工歧义,接收方有没有据此采取行动。
做成了,还要问哪些动作帮上了忙
只统计成功率,描述不了团队的工作方式。两个团队都完成了任务,一个分工明确、交接顺畅,另一个经历了大量重复采集、无效等待和信息误解,只看最终结果,两者会得到相同的成功标签。
为此论文提出了 Causal Collaboration Effectiveness(CCE,因果协作有效性)。它从团队最终完成的目标往回看,计算有多少行动被判定为推动了这个结果。
成功率回答的是团队有没有把事情做成,CCE 进一步追问,在做成这件事的过程中,哪些行动帮上了忙。它关注的贡献不限于最后完成任务那一步,也包括为后续行动提供材料、条件或有效信息的准备工作。
算法从完成目标的动作开始,沿时间向前回溯:这次制作依赖哪些材料,材料来自哪次转移,转移又依赖谁的采集或加工。借助大语言模型,对候选动作之间的因果依赖作出判断,逐步构建行动关系图。
计算方式并不复杂:成功任务的 CCE 等于被判定为对成功有贡献的动作数,除以团队执行的总动作数。论文示意图里,三个智能体一共执行了 27 个动作,其中 12 个被纳入通向任务成功的贡献链,CCE 约为 44.4%。
聊天也可能成为有贡献的动作。如果一条消息提供了后续行动所依赖的信息,它就有可能进入这条贡献链,是否计入取决于具体轨迹和判断规则,而不是只看它属于聊天还是工具调用。
论文将失败任务的 CCE 按定义记为 0,这是指标的计分约定,并不意味着失败过程中的每次尝试都毫无价值。跨任务平均 CCE 同时受到成功率和成功轨迹中贡献动作比例的影响,应与成功率、部分成功率结合阅读,不宜被当作一个独立的团队默契分。
失败发生在协作细节里
论文对通信轨迹的分析归纳出多类失败:重复询问已经解决的问题、认错角色或资源接收者、报告错误的物品信息,以及在关键步骤尚未完成时宣布任务结束。
这些现象说明,多智能体系统需要维护的不只是任务计划,还有不断变化的团队状态。
对系统开发者来说,AgentWorld 提供了进一步实验的场景:明确的角色分工能否减少误解,共享记忆能否帮助队伍同步进展,集中规划和分布执行各有什么优势,新的通信机制究竟提高了完成率,还是只增加了消息量。这些都应该通过对照实验来回答。
AgentWorld 的实验还不足以把协作困难归结为所有大模型的普遍上限。结果对应的是特定模型、提示、工具接口和执行协议,更丰富的规划、记忆或通信设计仍有探索空间。
但它把一个重要问题具体化了:衡量 Agent 团队,既要看成员能做什么,也要看它们能否在彼此依赖的条件下,共同把事情做完。随着多智能体系统被用于更复杂的工作流程,对协作能力的评测,也需要从对话质量延伸到实际行动。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.