8月20日凌晨,OpenAI联合创始人Greg Brockman在X上发了一条推文,浏览量很快破了18万。
他没有聊新模型,没有聊GPT-6,没有聊任何一个跑分数字。他说的是一件事,把Codex背后的发动机开源了。
![]()
被引用的那条公告,来自OpenAI官方开发者账号,发布时间比他早一个小时。
![]()
公告链接指向OpenAI官方开发者博客当天发布的一篇文章,标题叫《Codex as a platform: build on the open agent harness》,作者是Nicolas Bonamy和Derrick Choi。
文章用的封面图,是一张写着Codex as a platform的示意图。
![]()
推文列出三个开源组件,Codex CLI、Codex SDK和Codex app-server,并提到Relay这个演示应用
他们在开篇指出,大多数人通过App、CLI或IDE插件认识Codex,但这些只是同一套底层系统的不同入口。
真正的可复用部分是agent loop,理解任务、维持上下文、调用工具、处理失败、请求人类确认并返回结果。
围绕这个循环的执行系统,就是harness。
博客里的Figure 1把边界画得很清楚。你的应用拥有产品上下文、业务规则和工具,Codex app-server提供agent loop和沙箱执行。
OpenAI不打算让所有工作都塞进一个通用聊天窗口,它想让agent进入为具体工作设计的软件里,比如工程工作流、运营看板、安全调查或客户支持控制台。
![]()
开源Codex harness的论据,一部分来自OpenAI在ARC-AGI-3上的实验。
同一个GPT-5.6 Sol模型,在官方harness上得分13.3%。把reasoning保留并启用context compaction后,分数跳到38.3%,输出token还减少了六倍
模型没变,只是执行层设置变了,结果差距接近三倍
这个例子被OpenAI用来证明,benchmark测的不只是模型,还包括API设置harness设计和prompting。
![]()
在ARC博客同时引用了沃顿商学院教授 Ethan Mollick推文,正是因为它在真实任务里验证了同一个设置。
Mollick把GPT-5.6 Sol交给Codex,让它控制电脑玩《Slay the Spire 2》每日挑战。
![]()
每日挑战每次随机生成,没法靠背诵训练数据解决。Agent连续工作了五个多小时,做复杂游戏决策,最终通关。
截图里的 "Context automatically compacted" 说明,context compaction 支撑了这个长流程。它让agent在5小时里没有被上下文膨胀拖垮。
![]()
回到这次开源的内容。
GitHub仓库openai/codex的README把CLI描述为在终端本地运行的轻量级coding agent。
CLI之外,SDK提供直接编程接口,app-server负责持久会话、流式事件和审批处理。
三者覆盖了从一次性脚本、CI任务到完整产品内嵌agent的三种集成深度。
![]()
Relay是官方博客给出的示例,一个货运运营看板,旁边有一个由Codex app-server 驱动的agent。
harness负责agent loop、对话状态和工具调用,产品本身仍然拥有自己的看板、记录和控件。
用户选择一个货件并点击Compare recovery,应用把上下文交给agent。
agent 调用应用自有的 MCP 工具获取最新数据,解释可选方案,任何会改写数据的写操作都必须经过人工批准。
![]()
官方博客用了一个独立章节,叫What developers are building,讲已经在发生的公开实现。
博客发布后的第二天,OpenAI Developers在X上把其中的案例浓缩成了一条推文。推文点名了两家客户,Cisco和Thrive Holdings
![]()
案例一:自然语言进入网络控制台
离OpenAI最近的用法是IDE。GitHub和JetBrains把Codex接进了现有的IDE工作流,延续Codex一直做的事。
Cisco的用法更靠近产品内嵌,它在Cisco Cloud Control的App Builder里使用了Codex SDK。
![]()
案例二:7,000 份报税表背后的Agent
过去六个月,OpenAI的前线工程师和研究人员,与Thrive Holdings的工程师合作,给 Crete 打造了一个叫Tax AI的系统。
试点季里,它处理了7,000 份申报,准备时间缩短约三分之一。起草的申报准确率最高到97%,业务吞吐提升约50%。
![]()
案例三:在开发者工作台里安家的Agent
GitHub和JetBrains把Codex接进IDE工作流。
在JetBrains的AI chat里,用户可以直接调用Codex agent完成编码任务。用户可以调整权限,从简单问答到允许访问网络和自动运行命令。
![]()
回头看Greg Brockman那条推文。他说的是you can build your own products on our codex open-source harness,你可以基于我们的开源Harness构建自己的产品。
这句话的重心不在open-source,在your own products。OpenAI不再只是提供一个聊天框,它把Agent的执行层交出来,让开发者把它装进自己的产品里。
作为交换,开发者获得了一个现成的、经过生产验证的Agent运行时,不需要自己造轮子,也不用把业务流程塞进聊天框。
至于这条路走不走得通,要看接下来12个月,有多少企业内部系统,把agent loop跑在Codex app-server上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.