BREAKING · 发布解读 2026.07
拼参数就能赢?
ChatGPT大更新!
下半场拼工作流
三兄弟模型 · work agent 落地 · 闭环成了
ChatGPT 5.6 + Work
OpenAI Agent
4 Parts + Conclusion
滑动
PART 01
GPT 5.6 三兄弟
强在哪里
PART 02
ChatGPT Work
work agent 落地
PART 03
西兰花数学题
说明了什么
PART 04
实战怎么用
谁能用
PART ///
道与术
大家好啊,我是甲木。
家人们,盼星星、盼月亮,今天凌晨,终于把ChatGPT 5.6给盼来了。而且不止一个。
这场发布会 OpenAI 一口气端出俩:一个是新模型 GPT-5.6,
![]()
一个是全新的 Agent 工具 ChatGPT Work。
先来看看官方ChatGPT Work 的介绍视频:
官方 ChatGPT Work 视频介绍
最有意思的是隔壁友商。
![]()
Claude 看完这场发布会,连夜宣布「我们重置了大家的额度」,Codex 那边主管重置的 Tibo 还回了句。
昨天还跟朋友吐槽,天才程序员(Fable5)陨落了。。
![]()
一觉起来,我又行了!
![]()
降价的降价,重置额度的重置额度,神仙打架,爽的是我们用户。
好,我们挨个来看一下这次的更新。其实六月我写过一篇 Codex 的发布会前瞻——
Codex 正在从coding agent变成work agent,而且要把 Codex 直接塞进 ChatGPT。
今天,全兑现了。一个个说。
01
PART
GPT 5.6 三兄弟,强在哪里
THREE MODELS · 一个梯队三个身位
GPT-5.6 这次不是一个模型,是仨。
![]()
Sol,旗舰,意思是太阳。
Terra,均衡,意思是地球。
Luna,轻量,意思是月亮。
怎么看都眼熟对吧,数字 + 能力,一个梯队三个身位——这不就是Opus / Sonnet / Haiku的路子。咱也不知道跟谁学的 emm。
但这次我要替 OpenAI 说句好话。它总算把命名规则给捋顺了:数字管新旧,名字管强弱。5.7 Sol 一定比 5.7 Luna 强,6.0 Luna 一定比 5.9 Luna 新。
✦ 小道消息
据说 GPT6 系列继续开始「大力出奇迹」了,又要开始卷模型参数..
官方给出的核心变化,不只是「更聪明」,而是每个 token 能换到更多有效工作。
在 Agents' Last Exam 这个长链路专业任务评测上,Sol 拿到53.6 分;在 Artificial Analysis Coding Agent Index 上,Sol 是80 分。更重要的是,官方强调它完成同类编程任务时,用的输出 token 更少、耗时更短、成本也更低。
![]()
跑分当然不能当圣旨。
OpenAI 自己最近也在提醒行业:有些 benchmark 的题目会坏掉,有些会被模型「刷题」刷穿。真实生产力,还是要看模型能否稳定地接住上下文、调用工具、发现问题、交出结果。而 GPT-5.6 的提升,恰好集中在这些地方。
它可以先写一段轻量程序,协调浏览器、文件和其他工具,再把中间结果汇总回来;面对特别复杂的任务,ultra模式会并行调度多个 Agent。它生成网页后,也不只是把代码扔给你,而是能用 computer use 去检查实际渲染效果,发现视觉或交互问题再修一轮。
这件事听上去很小,但很关键。
以前很多模型像一位会写方案的实习生,第一稿很快,交付前的自检却得你来。现在的 GPT-5.6,更像是多了一道「自己先验收」的工序。
发布页放了一排 demo:帆船游戏、博物馆网站、发条村庄小游戏、室内设计演示,还有几个交互可视化——万花尺、波的干涉、GPT 分词器原理。
![]()
知识工作也是同一个逻辑。
OpenAI 重点展示了它如何把 Slack、Notion、Google Drive、Microsoft 365 里散落的笔记、邮件、表格,整理成能分享的文档、表格和 slide。说白了,AI 不再只负责给你一段回答,它开始要为一个可交付的成品负责。
02
PART
重头戏 ChatGPT Work:work agent 真落地了
WORK AGENT · 一句伏笔的成品
说回开头那句伏笔。六月我说,Codex 在从 coding agent 变 work agent。
ChatGPT Work,就是这句话的成品。当你再打开更新后的 Codex 时候,它提示——
![]()
它对标的是 Claude Work,底子还是 Codex,加了个 work 模式做了点调教。桌面、手机两端打通,一个任务能跨设备接力。
office 三件套——文档、PPT、表格——自然不在话下。它甚至能看完客户的邮件,自己去把客户那份 deck 给改了。
![]()
当然,这次最牛逼的新功能,还是Sites。
![]()
— site 路径
这个词,六月那篇我专门讲过:把你的想法、分析、计划,变成一个可交互的网页或 web app,生成一个 URL,直接甩给团队或者公开。
当时它还挂在 Codex 的 Business / Enterprise preview 里。这次,它落进了 ChatGPT Work,一会看实测。
一个 App,三个入口
这次新桌面 App 的改动很有意思。
原先独立的 Codex App,被并进了新的 ChatGPT 桌面端。里面有 Chat、Work、Codex 三个入口:Chat 用来讨论和获得答案,Codex 负责代码与更深的技术执行,Work 则面向跨工具、跨文件、跨时间的真实项目。
它们的边界未必会永远这么清楚,但用户的心智会清楚很多。这才是 Codex 真正的大规模分发。
Work 的背后,是 GPT-5.6 模型家族和 Codex 技术。它可以通过 plugins 连接 Slack、Teams、Google Drive、SharePoint、邮箱、日历、CRM、项目管理工具等上下文;还内置浏览器,支持一次性任务和定时任务。
✦ 顺带一提
还有个ultra模式挺有意思:同时跑 4 个 Agent 并行处理,专治特别复杂的任务,Pro 和企业用户能开。
把这几件事连起来看:ChatGPT 是几亿人每天打开的入口。以前 Codex 是个你得单独打开、还不一定知道啥时候该用的 app。
现在它成了ChatGPT 里随手可调的一档能力。这一步,才是 OpenAI 敢说「for every role」的底气。
03
PART
西兰花、数学题和谷物生意,说明了什么
REAL WORLD · 进入具体的行业现场
这两天 OpenAI 在 X 上转发的几个案例,挺有意思。
![]()
北海道有一位种植西兰花的农民,用 ChatGPT 和 Codex 管理 100 公顷农场:温室控制、卫星巡田、病害识别、经营数据,都被连进了自己的系统里。
还有一个「餐桌上的谷物生意」案例,一家人用 GPT-5.6 做经营分析和工作面板。听起来有点像 AI demo,但也正因为它不是什么硅谷创业公司,反而更能说明问题。
模型能力开始从写代码、做报告,进入很具体、很琐碎的行业现场。
数学案例更值得冷静看。
OpenAI 此前宣布,其内部模型自主解决了 Erdős 在 1946 年提出的一个离散几何猜想,外部数学家对证明进行了核验;Sam Altman 也在 X 上把它称作 GPT-5.6 的「发现新数学」时刻。严格说,官方数学文章写的是 internal OpenAI model,并没有在正文里把成果直接标为 GPT-5.6。
但不管最终模型标签怎么界定,这个信号已经很明确:我们讨论 Agent 时,它开始有机会进入过去需要长期专业判断的场景。
当然,离「自主替代专家」还远得很。数学证明有外部核验,农场系统也依赖人搭起传感器、业务规则和最终决策。
真正厉害的,从来不是 AI 凭空做了一个动作。
而是有人把自己的专业、数据、工具和验收标准,接成了一条能反复跑的工作流。
OpenAI 公布的企业案例也在证明这点。Virgin Atlantic 把原本要数周的航线与旅程对标工作压缩到数小时;Zapier 用它做销售线索分诊和管理看板;NVIDIA 则把活动前的 Excel 分析流程自动化,释放了约 40% 的人工分析时间。
这是把人的时间,从搬资料、对口径、改格式这些低价值环节里拿回来,让人去做判断、协调和拍板。
04
PART
实战:怎么用、谁能用
HANDS ON · PPT 与 Site 实测
ChatGPT Plus 用户今天就能用 GPT-5.6 了,Pro 用户能用 GPT-5.6 Sol,medium 及以上 effort 设置就行。
一键根据模板生成 PPT
设计类的这一块,其实我们还是需要去经过一些 skill 去进行配置的。
然后这里呢也可以预告一下,我这边实现了一个关于根据目标模板去一键适配 PPT 样式的 Skill,然后让 Codex 帮我去完成,效果非常好。
比如,我今天要去「观猹」做个分享,他们给的模板是这样:
![]()
通过 Skill 排版之后,能够直接基于目标模板的样式,自己去设计匹配的字体和素材。然后根据我整体的分享大纲内容,来给我生成配套的 PPT 组件,而且是真正的、可编辑的 PPT。
![]()
后续考虑把这个 Skill 开源,同样也能适配国内 Agent。
Site 站点实测
比如,我直接让它根据我当前的这个公众号排版的 GitHub 项目,帮我创建一个介绍这个公众号排版工具的网站。这个介绍公众号排版工具的网站要写得详细且具体。
![]()
— site 实测
它会直接给我生成一个网站,但是不知道为啥我测试的时候,显示没有接受部署请求...
![]()
生成的是「票据风」的主页。
![]()
Site 实测演示 GIF
其他还有很多场景,我还没来得及测,接下来会多测一波,看看它的真实项目体感,到时候再跟大家分享!
LAST
结语:道与术
CONCLUSION · 工作流才是护城河
六月那篇结尾,我拆过 Codex 更新的三件事:Plugins 解决接入,Annotations 解决反馈,Sites 解决交付。当时还缺两块——一块是够硬的模型底座,一块是统一的入口。
这次,5.6 把底座补上了,一个 App 把入口补上了。
闭环,成了。
AI 竞争的上半场拼模型,下半场拼工作流。
模型强不强,当然重要。但真正决定你能不能用出价值的,是你有没有把自己的工作,拆成Skills、上下文、工具连接、可交付成果。
你是运营,就搭运营的 Agent 工作流。
你是分析师,就搭数据分析的工作流。
你是老板,就搭项目推进、决策记录、复盘追踪的工作流。
模型每隔仨月就打穿一次上限。
而工作流,是你自己的护城河。
欢迎有实测 GPT-5.6 的朋友在评论区交流一下感受~
我先去睡觉了。。
以上。
我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。
THANKS FOR READING
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.