![]()
2026年的夏天,藏着很多不一样的AI信号。
字节系的豆包飞书合并;阿里巴巴推出千问办公;腾讯WorkBuddy月活破2000万……
Agent正式进入生产力场景,开始直面长程任务和复杂指令。
随之而来的,是Agent 从底层出发的优化手段,越来越显示出必要性。
因此,A2A、AI4AI 相关赛道也在加速:前MetaAI研究总监田渊栋创立的Recursive拿到6.5亿美元融资,估值46.5亿美元;专注「AI优化AI基础设施」的Wafer也拿到了种子轮融资。
从硅谷到国内,顶尖的智力和资本,都在流向新型的Agent基础设施。
而EvoMap,一支来自深圳、不到20人的年轻团队,已经做出来在海外很有反响的一个产品。
![]()
官网:https://evomap.ai/
GitHub: EvoMap/AutoResearch
它的名字叫EvoX,接下来,大概会被更多人记住。
01Agent 来到了十字路口
和身边朋友聊,EvoX的价值到底有多不一样;我们发现,得先理解现在大多数多 Agent 系统的问题出在哪。
今天的 Agent 任务系统基本有两种形态。
一种是把所有任务塞给一个 Agent,让它从头做到尾。
![]()
任务短的时候还行,任务一长,就会出现上下文截断、关键指令被淹没的问题。
第二种是更常见的「Agent Team 模式」:
一个主 Agent 负责拆任务,多个子 Agent 执行,最后子 Agent 把结果汇报给主 Agent 汇总。
![]()
看起来已经是多Agent了,但实际效果像传话游戏:每多传一层,就多一次出错的可能。
最后交付的,不一定是每个 Agent 做出来的最好结果,是主 Agent 在有限上下文里重新理解之后的结果。
这也是为什么 Sub-Agent 模式虽然调用了多个 Agent,执行成本甚至是三种模式中最高的,最终效果却仍然不理想。
多 Agent 真正的瓶颈从来不是数量,而是角色协作、多轮辩论和群体涌现的能力。
![]()
和几个清华朋友聊,有个共识:智能的基本单位,正在改变。
传统 LLM 的基本范式是:
Prompt → Context → Reasoning → Answer
而自进化 Agent 更接近:
Task → Action → Feedback → Experience → Reuse → Better Action
两者最大的区别,是后者开始形成一个真正意义上的 Experience Loop。
单纯堆参数的路径在放缓,真正的问题逐渐成了:怎么能充分发挥现有模型的智能,去优化那些在商业中发展停滞的老算法。
![]()
模型负责提供底层 intelligence,Agent 负责在真实环境里行动,而 Experience Network 则负责把大量 Agent 的行动结果组织起来。
所以从这个角度看,EvoMap 更像是在建立一个 Agent 的经验基础设施。
More than AI assistance. It's an agent matrix.
![]()
这个新的Agent自演化矩阵,说实话我挺期待的。
02EvoMap交出的一份答卷
之前大家了解到EvoMap,很多是2月龙虾爆火那时候。
曾经在 Clawhub 上架了自进化 Evolver 被全网讨论,和OpenClaw创始人Peter多次交锋,并且推出了 A2A 平台 EvoMap。
从Claude Code到Codex,海外最牛的Agent产品,很多框架也都落在了EvoMap的射程范围内。几乎可以说是国内最有野心、最有想象力的AI团队之一了。
他们最新拿出的成果,就是EvoX。
EvoX让Agent的经验,像基因一样沉淀下来。
![]()
第一次教它,以后都不用再教。
更关键的是它的「蜂群模式」:大量Agent没有中心调度节点,平级连接,根据任务信号自主选择协作对象、灵活组队——就像大自然中的蚁群蜂群一样。
个体简单,群体智慧涌现,而且这已经是被实验验证有效的机制。
![]()
在563道逻辑、数学、物理题上,使用同一个模型(Claude Haiku 4.5),单Agent正确率只有26.29%,Sub-Agent模式38.54%,而EvoX蜂群模式达到了70.69%到70.87%。
同样的模型,只是改变了组织方式,结果差了整整一倍多。
他们还开源了一个叫AutoResearch的项目,让一群Agent协作完成从科研Idea到实验、分析、评审的完整闭环。
![]()
在SWE-bench Lite的Django修复任务中,AutoResearch把官方新增功能测试从2/7推进到7/7,同时保持203个回归测试全部通过。
失败本身成为下一轮的输入。
当别人还在论证方向时,EvoMap已经把第一个答案交了出来。
03这套能力用在真实世界是什么样子
「AI优化AI」听起来很远,但落到真实场景里,其实每个人都看得懂。
比如外卖平台调度骑手。
今天的外卖平台用老算法分配订单,高峰期经常顾此失彼,骑手跑冤枉路、用户等餐久、平台成本高。
用AI去优化这套调度算法,让系统实时计算最优路线、动态调整派单策略,结果就是骑手少跑路、订单更快送达、平台每单成本下降……
最终可以实现三方都受益。
还有像医院问诊排号系统、大学生选课系统等等,背后都有一套老算法在运行,而AI可以比人类更快、更准地找到这套算法的优化空间。
当算法可以被AI 针对不同场景实时优化,那么距离AI自主优化Harness甚至模型也就更近了一步。
EvoMap做的事情,就是把「AI优化AI」从实验室,带到这些真实的产业场景里。
![]()
比如说,我想把杂乱并且变化的数据,整合成一个清晰的动态看板。
背后也是有多个虚拟项目,实时在发生变化,在看板上需要一套被AI优化过的算法,来完整呈现。
再比如,做一个可以调参数的宇宙模拟器。
我给到EvoX的指令很简单:
做一个宇宙模拟器,还原宇宙的形态,设定相关参数,可以手动调节,有光点、光晕等元素,星际穿越的感觉,输出html。
![]()
能看到它和一般的coding产品不一样,不是当成一次性任务直接开始写代码,是先编写完整文件、树立系统逻辑,确定更多审美偏好之后,才开始行动。
之前尝试过用当前最新、最牛的模型,还是没办法产出让人满意的效果。
EvoX出的这版效果,我就挺喜欢。
![]()
经常有一些要做网站的、做html格式动态呈现的任务,这也是之前我自己vibe coding经常搞的。
尝试了一下,做3D动态旋转效果的网站。
还是很简单的一句话指令。
![]()
这次我开启了蜂群模式,第一次尝试出现了失败,好在第二次就成功了。
![]()
最终完成的质量,水准不错。
六面体魔方,每个面都由图片组成,空间关系和旋转效果都符合预期。
之前用Opus 4.6,也可以实现,但是花了我非常久的时间,中间反复调试、改bug,让人只想放弃。
![]()
EvoX是在Agent的工作流里,加入了自优化、自分配,并行来处理复杂任务;所以很多中间琐碎的过程,帮我给承包了。
用在一些日常的复杂数据处理、多任务统筹安排分析等等场景,产出的完成度也很高。
![]()
在效率和效果上,比任何单独的大模型,明显有提升。
EvoX让我觉得,自进化这件事并不神秘,在日常的使用体验上优化是实打实的。
一群AI Agent自己去拆解问题、协作执行、沉淀经验,然后把这件事做快、做好、做便宜,而发出任务的我们可以更轻松。
用了以后会觉得,在EvoX,做任务可以很丝滑,而且越用越懂我。
04
眼下,Agent的基础设施早就呼之欲出了。
大厂在铺路,顶尖科学家在押注,资本也在投票。
AI优化AI,用Agent服务Agent,为Agent打造新基建,每一个细分环节都有独角兽的机会。
而EvoMap,一支不到20人的深圳团队,已经把成果摆在了桌面上。
![]()
如果说模型的 Scaling,解决的是「一个大脑有多聪明」;
那么 Agent 的 Scaling 解决的则是「一个人能做多少事」;
而 EvoX 解决的可能是「AI自进化基础设施」,让整个 Agent 网络一起变得越来越会做事。
EvoX已经可以下载、体验,还有完全开源的AutoResearch的代码,在GitHub上可以读、可以跑。
比起现在,未来的EvoX,我会更期待。
![]()
朋友圈会发一些具体的案例和商业化日常~
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.