网易首页 > 网易号 > 正文 申请入驻

Agent组队干活,最强模型只完成50%任务!基准评测协作能力

0
分享至


新智元报道


个体能力强大的AI Agent正不断涌现。从编写代码、开发软件,到检索文献、辅助科学研究,它们能独立完成的工作越来越多。

但随着这些「超级个体」变得更强,一个同样重要的问题也浮现出来:它们能否合作?

回看人类社会,许多复杂成就都依赖一群人的分工与协作。假如我们要组建一家公司,制造火箭、登上月球,首先要考虑的,恐怕不是寻找一个无所不能的天才,而是如何组织一支团队:需要哪些专业人才,怎样分工,如何共享信息,又如何让不同环节的工作衔接起来。

从科学发现到大型工程,个体能力固然重要,组织和协作也决定了我们能够走多远。

这让我们开始思考:当大模型和Agent的个体能力持续增强时,它们的协作能力发展到了什么程度?面对一个共同目标,它们会不会主动交换信息、协调分工?当多个智能体一起工作时,能否真正发挥各自的优势,让复杂任务更容易完成?

带着这些问题,OpenAgents、哥伦比亚大学、宾夕法尼亚大学、首尔大学和宾夕法尼亚州立大学的研究者共同构建了AgentWorld:一个面向多智能体协作能力的评测基准(benchmark)。


论文链接:https://arxiv.org/abs/2609.31590

项目网站:https://agentworld.io/

代码与数据:https://github.com/openagents-org/agentworld

研究团队关心的是:当多个智能体拥有不同的角色、能力和资源,并需要共同完成一项任务时,它们能否形成有效的分工、保持信息同步,并把各自的行动连接起来,最终实现共同目标。

AgentWorld又补上了什么?

近年来,科研界已经在探索让多个大模型通过对话、角色分工和相互反馈共同解决问题,也提出了面向协作的评测任务,以及游戏和社会模拟环境。

随着这些研究推进,一个需要进一步回答的问题是:当任务持续数十轮、成员掌握不同资源,而且每一步都可能影响队友时,团队能否持续保持有效协作?

AgentWorld 的特色,在于把长时程任务、角色不对称和黑盒交互结合到同一个协作评测环境中。

高层工具减少了导航、操作等低层控制的干扰,程序化规则检查共同目标是否完成;进一步提出的CCE指标,则追溯哪些行动和消息被判定为对结果有贡献。这样,评测既能观察团队是否成功,也能分析跨角色的交接与配合如何促成成功。

AgentWorld简介

一支由10个智能体组成的团队,进入了一个角色扮演游戏(RPG)世界。

想象这样一个任务:给队伍里的法师做一根魔法杖。伐木工负责采集木材,木工把木材加工成木棒,法师再用木棒和自己持有的材料完成制作。看上去,只要各司其职就行。

但真正执行起来,问题可能出在任何一次交接:木材该交给谁?木棒准备好了没有?队友已经完成的步骤,还要不要重复做?任务尚未完成时,有没有人提前宣布「收工」?

这些问题,正是多智能体协作系统需要面对的考验。

AgentWorld是一个面向Agent协作能力的评测基准(benchmark):让多个由大语言模型驱动的智能体,在同一个持续变化的环境中分工、沟通、共享资源,并共同完成任务。

在论文报告的四个主模型实验中,主任务集上的最高成功率为52.0%。这个结果提出了一个值得研究的问题:当单个Agent的能力不断提升,团队层面的协作还缺少什么?


图 1|AgentWorld 环境示例:不同角色拥有各自的视角,通过游戏内聊天交流。截图展示一个十智能体团队,不对应下文的三智能体魔法杖任务。

把「会协作」变成可以测量的能力

「多个Agent参与」是一种系统结构,「多个Agent有效协作」则是一种需要验证的能力。

如果只是让几个模型分别回答问题,再汇总答案,我们仍然很难知道:它们能否理解彼此的职责,能否在资源不足时调整分工,又能否根据队友的最新进展修改计划。

AgentWorld把这些问题放进了一个MMORPG沙盒,也就是多人在线角色扮演游戏环境。这里有可采集的资源、可制作的物品、需要应对的敌人,以及不同位置上的队友。智能体的行动会改变环境,也会影响其他成员下一步能做什么。

游戏提供了可执行、可观察的协作场景;评测关注的是团队能否把共同目标推进到完成。

论文介绍的任务集由100个人工设计任务和100个增强变体组成,涵盖战斗、制作、采集、交易、探索、生存、建造和协调等类型。任务需要3至20个智能体参与,许多任务包含连续的资源交接与行动依赖。

这一设计把协作从一段听起来合理的对话,变成了一串必须真正发生的动作。

三个设计

让协作难题显现出来

首先是角色不对称。不同智能体拥有不同技能、物品和初始条件。队伍需要根据这些差异安排工作,而不是让所有成员执行同一套动作。

在魔法杖任务中,伐木、加工、制作形成一条依赖链。即使每个成员都知道最终目标,团队仍然需要解决「谁先做、交给谁、什么时候交」的问题。


图 2|另一个任务示例:十名智能体承担采矿、冶炼、锻造、支援和协调等职责,共同完成物品制作目标。角色配置使分工与资源传递成为任务的一部分。

其次是黑盒交互。智能体不能直接读取队友的内部推理状态。它需要通过环境观察、聊天和行动结果,判断其他成员在做什么。这让「我以为队友已经做完了」成为真实的失败来源。

第三是多轮执行。一份开局计划无法覆盖所有后续变化。队伍必须在执行中持续更新状态:资源是否到位、队友是否需要支援、原先的分工是否仍然有效。论文中的主任务设置了数十轮的执行预算,要求智能体在多次交接中保持协调。

为了减少低层操作的干扰,AgentWorld 提供了 13 个高层 API 工具。例如,采集或攻击工具可以封装导航和具体执行流程,让模型把更多决策放在「下一步做什么」和「与谁配合」上。

这并不意味着评测完全排除了规划和工具使用的影响,但它让协作问题更容易被观察和分析。

最好的团队完成约一半任务

聊天更多也未必更好

研究在统一的提示模板、工具定义和交互协议下,评测了 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B。

主任务集上,四个模型的任务成功率分别为 52.0%、45.0%、36.0% 和 20.0%。在增强任务集上,对应成功率为 24.0%、26.0%、21.0% 和 10.0%。


图 3|按照论文主结果表重绘。这里比较的是各模型驱动的团队,在论文指定设置下的表现;不代表对所有Agent系统设计的能力上限判断。

值得注意的还有「做到一部分」和「真正做完」之间的差距。Gemini 3 Flash 在主任务集上的部分成功率为71.5%,完整任务成功率为52.0%。团队推进了一些中间目标,并不保证最后的资源交接或制作步骤能够完成。

通信量也没有呈现「越多越好」的简单关系。GPT-5 Mini平均每个主任务发送44.1条聊天消息,但成功率为36.0%;Gemini 3 Flash平均发送11.0条,成功率为52.0%。

这组结果并不能证明少聊天会提升成功率,但它提醒我们:消息数量无法直接替代协作质量。

更值得关注的是,一条消息是否更新了有效信息,是否消除了分工歧义,以及接收方是否据此采取了行动。

完成任务之外,还要追问:哪些行动帮上了忙?

只统计成功率,还不足以描述团队的工作方式。

两个团队都完成了任务,其中一个分工明确、交接顺畅,另一个经历了大量重复采集、无效等待和信息误解。如果只看最终结果,两者会得到相同的成功标签。

为此,论文提出了Causal Collaboration Effectiveness(CCE,因果协作有效性)。

它从团队最终完成的目标往回看,计算有多少行动被判定为推动了这个结果。

成功率回答的是「团队有没有把事情做成」,CCE则进一步追问「在做成这件事的过程中,哪些行动帮上了忙」。它关注的贡献不限于最后完成任务的那一步,也包括为后续行动提供材料、条件或有效信息的准备工作。

它从完成目标的动作开始,沿时间向前回溯:这次制作依赖哪些材料?材料来自哪次转移?转移又依赖谁的采集或加工?算法借助大语言模型,对候选动作之间的因果依赖作出判断,逐步构建行动关系图。


图 4|论文中的CCE示意图:伐木工、木工和法师的行动通过跨角色依赖相连。图中 12/27 是这条示意轨迹的贡献动作占比,不是整个数据集的平均结果。

计算方式并不复杂:

成功任务的 CCE = 被判定为对成功有贡献的动作数 ÷ 团队执行的总动作数。

以图4的示意轨迹为例,三个智能体一共执行了27个动作,其中12个被纳入通向任务成功的贡献链,因此CCE = 12 ÷ 27 ≈ 44.4%。

法师制作魔法杖是直接完成目标的动作;伐木工采集和转交木材、木工加工和交付木棒,则可能通过后续依赖间接促成成功。

聊天也可能成为有贡献的动作。如果一条消息提供了后续行动所依赖的信息,它就有可能进入这条贡献链;是否计入取决于具体轨迹和判断规则,而不是只看它属于「聊天」还是「工具调用」。

论文将失败任务的CCE按定义记为0。这是指标的计分约定,并不意味着失败过程中的每次尝试都毫无价值。

因此,跨任务平均CCE同时受到成功率和成功轨迹中贡献动作比例的影响。它应与成功率、部分成功率结合阅读,而不宜被当作一个独立的「团队默契分」。

这里需要区分两个概念:平均每个任务的动作占比,不等于把所有任务动作汇总后计算出的总体占比。也不能把没有被回溯为成功贡献的动作,一概理解为毫无意义;必要探索、信息不足下的尝试,以及判断误差都需要考虑。

CCE的价值在于提供一个可检查的分析视角,帮助研究者追问团队的工作过程。它仍依赖模型判断,也不能单独证明一套系统已经具备通用协作能力。

从重复劳动到提前收工

失败发生在协作细节里

论文对通信轨迹的分析归纳出多类失败:重复询问已经解决的问题、认错角色或资源接收者、报告错误的物品信息,以及在关键步骤尚未完成时宣布任务结束。

这些现象说明,多Agent系统需要维护的不只是「任务计划」,还有不断变化的团队状态。

对系统开发者而言,AgentWorld提供了进一步实验的场景:明确的角色分工能否减少误解?共享记忆能否帮助队伍同步进展?集中规划和分布执行各有什么优势?新的通信机制究竟提高了完成率,还是只增加了消息量?

这些都应通过对照实验回答。一个协作benchmark的作用,就是让方法改进能够落在相同任务、相同规则和可复查的执行记录上。

从「各自能干」走向「共同完成」

AgentWorld 的实验还不足以把协作困难归结为所有大模型的普遍上限。结果对应特定模型、提示、工具接口和执行协议,更丰富的规划、记忆或通信设计仍有探索空间。

但它把一个重要问题具体化了:衡量Agent团队,既要看成员能做什么,也要看它们能否在彼此依赖的条件下,共同把事情做完。

随着多智能体系统被用于更复杂的工作流程,对协作能力的评测也需要从对话质量延伸到实际行动。AgentWorld 为这种评测提供了一个可运行、可比较的实验环境。

参考资料:

https://arxiv.org/abs/2609.31590

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
38岁毛晓彤成都车展穿流苏亮片裙,4万朵云南玫瑰铺满展台

38岁毛晓彤成都车展穿流苏亮片裙,4万朵云南玫瑰铺满展台

手工制作阿歼
2026-10-10 03:17:35
河南三兄弟一直光棍,父亲发声,表示无奈,网友:这样的网贷都拒

河南三兄弟一直光棍,父亲发声,表示无奈,网友:这样的网贷都拒

刘哥谈体育
2026-10-10 00:17:59
台湾丐帮成员牛煦庭语出惊人!蔡康永不是站台,没必要大惊小怪,抵制他只会适得其反

台湾丐帮成员牛煦庭语出惊人!蔡康永不是站台,没必要大惊小怪,抵制他只会适得其反

小徐讲八卦
2026-10-09 13:11:42
多次阴阳中国,斯维托丽娜被郑钦文横扫淘汰,郑钦文:现在赢比赛就像喝水一样正常

多次阴阳中国,斯维托丽娜被郑钦文横扫淘汰,郑钦文:现在赢比赛就像喝水一样正常

尘语者
2026-10-10 09:33:26
闹大了,周星驰问张艺兴:下次我还找你拍戏,零片酬行吗,张艺兴回应显情商,他在片场长时间暴晒,皮肤晒得黝黑,完全褪去了精致妆感

闹大了,周星驰问张艺兴:下次我还找你拍戏,零片酬行吗,张艺兴回应显情商,他在片场长时间暴晒,皮肤晒得黝黑,完全褪去了精致妆感

不二大叔
2026-08-01 11:01:41
罕见低头!泽连斯基首次公开认栽:打了这么多年仗,我犯了无数错

罕见低头!泽连斯基首次公开认栽:打了这么多年仗,我犯了无数错

老马拉车莫少装
2026-09-24 21:22:49
韩媒:要想晋级洛杉矶奥运会,韩国U21国家队需克服多重困难

韩媒:要想晋级洛杉矶奥运会,韩国U21国家队需克服多重困难

懂球帝
2026-10-10 01:57:50
12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

墨策讲历史
2026-08-21 19:27:44
伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

扶苏聊历史
2026-10-09 11:50:53
香港男星疑似二度中风,结婚多年选择丁克,晚年的他会后悔吗?

香港男星疑似二度中风,结婚多年选择丁克,晚年的他会后悔吗?

娱圈办事处
2026-10-09 12:52:01
松岛存致命性格缺陷!张本美和赛后不满他提前放弃 中泽锐指令也不执行

松岛存致命性格缺陷!张本美和赛后不满他提前放弃 中泽锐指令也不执行

颜小白的篮球梦
2026-10-09 12:35:13
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
演员谭松韵撰文谈《兰香如故》:一部好剧,让两岸共赏一脉相承的文化

演员谭松韵撰文谈《兰香如故》:一部好剧,让两岸共赏一脉相承的文化

澎湃新闻
2026-10-09 08:14:07
中日关系现新信号!高市早苗发表施政演说,公开对中国说软话?

中日关系现新信号!高市早苗发表施政演说,公开对中国说软话?

飘逸的云朵
2026-10-10 05:14:51
“一丝不挂”还不知廉耻!内娱为艺术献身的流氓真相,该打破了

“一丝不挂”还不知廉耻!内娱为艺术献身的流氓真相,该打破了

小椰的奶奶
2026-10-07 17:01:44
给近8年最好的10部古装权谋宅斗剧排名,兰香如故第4,第1没争议

给近8年最好的10部古装权谋宅斗剧排名,兰香如故第4,第1没争议

情感大头说说
2026-10-07 14:31:27
俄媒这句话直接封神了,“只有把中国惹急了,世界才会安静下来”

俄媒这句话直接封神了,“只有把中国惹急了,世界才会安静下来”

飘逸语人
2026-10-09 23:14:04
曝73岁老戏骨濮存昕车祸现场!对方自行车被卷车底,掉鞋瘫坐在地

曝73岁老戏骨濮存昕车祸现场!对方自行车被卷车底,掉鞋瘫坐在地

大鱼简科
2026-10-10 09:30:54
黄仁勋女儿低调完婚!三星掌门人“爆料”!女婿火速直升副总裁

黄仁勋女儿低调完婚!三星掌门人“爆料”!女婿火速直升副总裁

静若梨花
2026-10-09 09:57:42
【油价大降】超9毛/升,下半年“跌2次”的油价,10月“再次下降”,10月15日汽柴油或再跌“超2毛/升”

【油价大降】超9毛/升,下半年“跌2次”的油价,10月“再次下降”,10月15日汽柴油或再跌“超2毛/升”

油价早知道
2026-10-10 09:31:00
2026-10-10 10:51:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16390文章数 67153关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

国庆假期"房车大军"火了 有一家三口6天只花1600余元

头条要闻

国庆假期"房车大军"火了 有一家三口6天只花1600余元

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

王仁君获飞天视帝,赵丽颖发文祝贺

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

家居
时尚
数码
手机
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

时尚早知道!2027春夏十大流行趋势

数码要闻

联想拯救者27U-20显示器开售:27英寸4K 180Hz双模,1699元

手机要闻

行业首创阔直板爆火!华为Pura X View销量已突破40万

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版