网易首页 > 网易号 > 正文 申请入驻

重置额度之神 Tibo,剧透了 Codex 下一次大更新

0
分享至

Codex 用户大概都知道重置额度的神 Tibo 。

过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。

今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。

Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。


在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?

答案可太有节目效果了——Tibo 真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。


不过这场访谈更有意思的部分,还不仅仅是这个按钮。

几周前,Tibo 说过一句很大的话:

再过两三个月,今天的 Codex 会显得很原始。

Tibo 到底看见啥了?


Tibo到底为啥说codex会变得「原始」?

Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。

Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。

主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。


Tibo 则不太喜欢这种状态。

他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。

笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。

AI 却是这样工作的。

所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。

然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。

AI 到底有没有开始「自己改自己」

RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。

就这么一直滚下去。

这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。


一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?

2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。

理论很好看,工程上基本没法这么干。


软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。

于是乎,后来大家换了种办法。

先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。

今年 Karpathy 开源的 autoresearch 比较直观。

给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。


涨了就留。掉了就撤。然后继续。

人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。

Tibo 在访谈里把 RSI 的范围说得更宽。

模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。

说得夸张一点,就是:AI 左脚踩右脚,机械飞升。


不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。

好的修改有没有留下来,坏的缺点有没有被放大?

新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?

这个循环是不是真的跑了不止一次,还是一两轮增益就停了?

这些都得再看,任重而道远啊!少年AI!

现在已经走到哪一步了

近两年的公开案例里,「自我改进」其实已经有了好几种样子。

R-Zero 已经开始让模型自己给自己出题。

一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。


不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。

OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。

再看 Anthropic 是怎么做的。


他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。

人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。


所以现在的 AI 已经不只是「帮研究员写代码」了。

它开始出题、跑实验、改系统,甚至真的碰到了生产环境。

至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。

不过非常期待科研工作者们有下一步突破,为他们加油吧!

分数涨了,不一定真变强了

循环一旦能自己跑,马上就会引出另一些问题。

谁来判断「变好了」?如何定义「变好了」?

Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。

有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。

最后分数还真能涨。只是涨得有点不是地方。

这就是 reward hacking。


如果连评测器也交给 AI 自己改呢?

最近好多人都在尝试这个方向。

可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!

研究方向也有类似的问题。

Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。

Anthropic 把这种判断叫 research taste,研究品味。


Agent 的运行时间拉长以后,也没那么乐观。

有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。

到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。

Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。

反馈循环本身也有两面。

Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。


好的修改可以留下。坏的也可以。

Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。

下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。

所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
生涯首进美网八强!新科温网冠军苦战晋级,豪夺大满贯11连胜

生涯首进美网八强!新科温网冠军苦战晋级,豪夺大满贯11连胜

全景体育V
2026-09-07 05:51:35
他修了座假景点,门票400元还成热门打卡地,靠编故事成为历史学家

他修了座假景点,门票400元还成热门打卡地,靠编故事成为历史学家

万物杂志
2026-09-05 06:35:49
郑钦文今晚第九次战斯瓦泰克!赔率1.24 vs 4.10,郑钦文不被看好

郑钦文今晚第九次战斯瓦泰克!赔率1.24 vs 4.10,郑钦文不被看好

嘛呢八十分
2026-09-07 06:51:39
五大联赛神剧情!89分钟绝平+93分钟绝杀 上赛季季军2-1逆转登顶

五大联赛神剧情!89分钟绝平+93分钟绝杀 上赛季季军2-1逆转登顶

狍子歪解体坛
2026-09-06 11:33:04
央视科普的“高钾晚餐”火了!连吃21天,腰围悄悄缩8cm

央视科普的“高钾晚餐”火了!连吃21天,腰围悄悄缩8cm

周哥一影视
2026-09-07 04:24:03
中国超级跑车锦标赛一赛车剧烈碰撞起火,车手弃赛冲进火海救人,被救车手发文:我欠你一条命;王一博点赞转发救人视频

中国超级跑车锦标赛一赛车剧烈碰撞起火,车手弃赛冲进火海救人,被救车手发文:我欠你一条命;王一博点赞转发救人视频

蓬勃新闻
2026-09-06 17:04:10
网红百叶窗暗藏视角盲区,女生租房三年,卫生间惨遭俯视裸奔三年

网红百叶窗暗藏视角盲区,女生租房三年,卫生间惨遭俯视裸奔三年

行者聊官
2026-09-06 10:44:58
泡泡玛特创始人王宁到访LVMH总部,向LVMH集团掌门人阿尔诺赠送了一只LABUBU

泡泡玛特创始人王宁到访LVMH总部,向LVMH集团掌门人阿尔诺赠送了一只LABUBU

鲁中晨报
2026-09-06 09:15:02
被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

汉史趣闻
2026-09-02 18:57:28
被网友的「锅子清洁大法」惊呆了!用了10多年,依旧干净锃亮

被网友的「锅子清洁大法」惊呆了!用了10多年,依旧干净锃亮

装修秀
2026-09-05 15:49:07
每体:巴萨在统治西甲,甚至不需要买小蜘蛛

每体:巴萨在统治西甲,甚至不需要买小蜘蛛

懂球帝
2026-09-07 01:33:41
解放军将伤亡惨重?民调曾显示:台92%人不支持回归!要抵抗到底

解放军将伤亡惨重?民调曾显示:台92%人不支持回归!要抵抗到底

好贤观史记
2026-09-06 13:37:14
小米最高端旗舰18 Fold今晚发布!卢伟冰称发布会有惊喜 雷军讲全场

小米最高端旗舰18 Fold今晚发布!卢伟冰称发布会有惊喜 雷军讲全场

快科技
2026-09-07 08:11:05
斯诺克最新世界排名:琼斯夺冠飙升9位!紧追常冰玉,吴宜泽下滑2位

斯诺克最新世界排名:琼斯夺冠飙升9位!紧追常冰玉,吴宜泽下滑2位

球场没跑道
2026-09-07 07:06:19
R星做的玉足越来越真实!《GTA6》对比进步肉眼可见

R星做的玉足越来越真实!《GTA6》对比进步肉眼可见

游民星空
2026-09-06 12:43:27
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
Nike球衣“走光”,阿卡靠白背心“保咪”

Nike球衣“走光”,阿卡靠白背心“保咪”

设计癖
2026-09-06 23:11:35
巨亏近100亿,高瓴割肉跑了

巨亏近100亿,高瓴割肉跑了

投资家
2026-09-01 20:45:25
“美航母遭弹道导弹袭击”

“美航母遭弹道导弹袭击”

第一财经资讯
2026-09-06 14:40:24
第一次去老年大学,我以为自己是去学习的,结果是去比退休金的

第一次去老年大学,我以为自己是去学习的,结果是去比退休金的

荷兰豆爱健康
2026-09-06 06:12:43
2026-09-07 09:19:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6774文章数 26904关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
艺术
手机
数码
公开课

《剑星》伊芙赛博忍者Mod 风格热辣性感动人

艺术要闻

毛泽东写《兰亭序》,史上最霸气版本!

手机要闻

Tim Cook或十几年来首度缺席苹果秋季发布会

数码要闻

利民推出TROFEO VISION 360 ARGB WHITE水冷散热器,售729元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版