智猩猩AI整理
编辑: 没方
如果让 AI 去解决一个连人类都不知道答案的问题,它应该怎么干?
不是搜几篇网页,再拼一个看起来合理的回答。
它得像真正的研究团队一样,提出假设、找证据、写代码验证、发现方向不对再推翻重来,甚至让多个 Agent 同时探索不同路线。
这正是陈天桥正在押注的一条 AI 路线。
今年4月,他出资并亲自主导创立ApodexAI。其技术前身来自此前布局的MiroMind项目。在对后者完成战略调整与技术重构,优化迭代为全新主体ApodexAI。
这家新公司给自己的定位是 Heavy-Duty Solver:不满足于回答已有问题,希望让 AI 去解决那些没有标准答案、甚至人类自己都不知道从哪下手的难题。
远点看,他们瞄准的是 AI 自进化,乃至 RSI(Recursive Self-Improvement)。
但问题来了。
要走向 AI自进化,意味着 AI 得能够独立跑完长时程任务,持续调用工具、管理文件和状态,还要支持暂停、恢复、人工干预以及多路并行探索。
单靠模型本身远远不够,还需要一套完整的 Agent Runtime 来支撑。
因此 ,ApodexAI 最近在开源 Apodex 1.1 模型家族的同时,就把自己内部使用的一套 Agent Harness 也开源了,名字叫FrontierAgent。
![]()
FrontierAgent 特别的地方在于,它把平时散落在不同 Agent 项目里的东西,比较完整地捏在了一起。
任务运行、文件环境、状态保存、多 Agent 调度、人工干预、操作审批、失败恢复、结果交付和 Benchmark 评测,都放进了 Harness 体系。
此外, Apodex 1.1模型相关技术的论文还登上了huggingface热榜第一。
![]()
01
安装教程
安装指令:
cp .env.example .env接着在.env中配置模型信息:
JINA_API_KEY=启动后界面如下,跟 Claude Code 差不多:
![]()
FrontierAgent 原生提供两套 Workflow。
第一套是 Stateful ReAct, 启动指令:
uv run frontier-agent --mode react --cwd /path/to/project这个模式比较适合明确、聚焦的任务,比如分析代码仓库、读论文、处理文档、调查一个具体问题。它只有一个 Agent,但这个 Agent 是有状态的。
它会持续在一个独立 Workspace 里查网页、读文件、跑 Shell、写代码、生成结果,而不是每执行一步就把之前发生的事情忘掉。
我让它帮我读取了 Apodex_AI 的最新两条推文,结果如下:
![]()
另一套则是 FrontierAgent 更有特色的 Agent Team。 启动指令:
uv run frontier-agent --mode agent_team --cwd /path/to/project这时候,任务不再只交给一个 Agent。
系统会先启动一个 Coordinator,由它负责把问题拆开,然后建立一块 Task Board,把不同子任务分给多个 Sub-Agent 并行执行。
各个 Sub-Agent 完成以后,会把结构化报告交回来,最后再由 Coordinator 汇总、检查和生成最终答案。
这个过程是能看见的。
FrontierAgent 的侧边栏会实时显示 Task Board,每个子任务是 pending、active、completed,还是已经 blocked,都可以直接看到。
![]()
02
FrontierAgent连
评测系统一起开源
FrontierAgent 还有一个很少见的地方,它连评测系统也一起开源了。
仓库里直接带了一套 Benchmark,目前已经接入 BrowseComp、BrowseComp-ZH、Humanity's Last Exam、FrontierScience、OfficeQA、GDPval、APEX、OneMillion-Bench 等。
值得注意的是,ApodexAI 自己评测模型时,用的也是 FrontierAgent 的同一套 Workflow Engine。
这就让它和很多为了展示 Agent 效果临时拼出来的 Demo 不太一样。
开发者拿到的,基本就是 ApodexAI 自己用来跑复杂任务、测模型的那层执行系统。
从 ApodexAI 公布的评测结果能明显看出 Harness 的影响。
![]()
同样是 Apodex 1.1,换成 Agent Team 之后,6 项 Benchmark 全部高于单 Agent ReAct:GDPval 从 69.5 提升到 78.8,FrontierScience-Research 从 55.0 提升到 63.3,BioMysteryBench 更是从 23.5 提升到 35.3。
在 FrontierFinance 和 FrontierScience-Research 上,Agent Team 甚至超过了图中多款头部模型。
这说明,同一个模型放进不同的 Agent Workflow,最终表现可能完全不一样。Harness,正在从“工程配套”变成模型能力的一部分。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.