网易首页 > 网易号 > 正文 申请入驻

重置额度之神 Tibo,剧透了 Codex 下一次大更新

0
分享至

Codex 用户大概都知道重置额度的神 Tibo 。

过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。

今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。

Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。


在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?

答案可太有节目效果了——Tibo 真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。


不过这场访谈更有意思的部分,还不仅仅是这个按钮。

几周前,Tibo 说过一句很大的话:

再过两三个月,今天的 Codex 会显得很原始。

Tibo 到底看见啥了?


Tibo到底为啥说codex会变得「原始」?

Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。

Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。

主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。


Tibo 则不太喜欢这种状态。

他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。

笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。

AI 却是这样工作的。

所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。

然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。

AI 到底有没有开始「自己改自己」

RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。

就这么一直滚下去。

这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。


一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?

2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。

理论很好看,工程上基本没法这么干。


软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。

于是乎,后来大家换了种办法。

先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。

今年 Karpathy 开源的 autoresearch 比较直观。

给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。


涨了就留。掉了就撤。然后继续。

人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。

Tibo 在访谈里把 RSI 的范围说得更宽。

模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。

说得夸张一点,就是:AI 左脚踩右脚,机械飞升。


不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。

好的修改有没有留下来,坏的缺点有没有被放大?

新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?

这个循环是不是真的跑了不止一次,还是一两轮增益就停了?

这些都得再看,任重而道远啊!少年AI!

现在已经走到哪一步了

近两年的公开案例里,「自我改进」其实已经有了好几种样子。

R-Zero 已经开始让模型自己给自己出题。

一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。


不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。

OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。

再看 Anthropic 是怎么做的。


他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。

人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。


所以现在的 AI 已经不只是「帮研究员写代码」了。

它开始出题、跑实验、改系统,甚至真的碰到了生产环境。

至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。

不过非常期待科研工作者们有下一步突破,为他们加油吧!

分数涨了,不一定真变强了

循环一旦能自己跑,马上就会引出另一些问题。

谁来判断「变好了」?如何定义「变好了」?

Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。

有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。

最后分数还真能涨。只是涨得有点不是地方。

这就是 reward hacking。


如果连评测器也交给 AI 自己改呢?

最近好多人都在尝试这个方向。

可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!

研究方向也有类似的问题。

Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。

Anthropic 把这种判断叫 research taste,研究品味。


Agent 的运行时间拉长以后,也没那么乐观。

有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。

到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。

Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。

反馈循环本身也有两面。

Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。


好的修改可以留下。坏的也可以。

Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。

下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。

所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“虽然不漏不性感,但就是很成人化!”老师晒一年级女孩穿搭,引争议不断!

“虽然不漏不性感,但就是很成人化!”老师晒一年级女孩穿搭,引争议不断!

林林先生
2026-09-04 09:44:55
轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

梦史
2026-09-06 00:39:59
44万人欠信用卡,银行连官司都懒得打了

44万人欠信用卡,银行连官司都懒得打了

知肇分子
2026-09-04 23:43:57
罗萨里奥德比第10分钟致敬梅西,迪马利亚为梅西献上掌声

罗萨里奥德比第10分钟致敬梅西,迪马利亚为梅西献上掌声

懂球帝
2026-09-07 02:57:10
哇塞!重磅,乐福!这一等,就是整整12年……

哇塞!重磅,乐福!这一等,就是整整12年……

体育新角度
2026-09-06 21:58:56
首次质量督查:督察发现153个问题,已移交属地处置

首次质量督查:督察发现153个问题,已移交属地处置

界面新闻
2026-09-06 09:45:01
朱艺:成都攻击手费利佩、韦世豪、拜合拉木下轮均将四黄停赛

朱艺:成都攻击手费利佩、韦世豪、拜合拉木下轮均将四黄停赛

懂球帝
2026-09-07 09:19:25
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
乌克兰首次确认瑞典预警机已参战,F16获得空中雷达支援

乌克兰首次确认瑞典预警机已参战,F16获得空中雷达支援

桂系007
2026-09-05 23:57:12
丰田新车官宣:9月21日,正式上市

丰田新车官宣:9月21日,正式上市

科技堡垒
2026-09-06 11:39:30
为啥买熟食的人变少了?行家:一斤鲜牛肉煮出两斤酱牛肉,啥原因

为啥买熟食的人变少了?行家:一斤鲜牛肉煮出两斤酱牛肉,啥原因

铜臭的历史味
2026-09-04 00:51:38
54岁朱茵被骂胸垂到肚!她没骂一句,两张照片让港媒闭嘴

54岁朱茵被骂胸垂到肚!她没骂一句,两张照片让港媒闭嘴

草莓解说体育
2026-09-06 13:43:51
中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

懂球帝
2026-09-06 22:12:19
凌晨2点,印度客户发来消息:取消发货前付款,改成货到付款

凌晨2点,印度客户发来消息:取消发货前付款,改成货到付款

宝哥精彩赛事
2026-09-06 05:14:36
留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

蚂蚁大喇叭
2026-09-05 17:11:29
西甲夺冠热门诞生:4战全胜,领跑积分榜,亚马尔梅开二度,1亿天才太犀利:独造3球

西甲夺冠热门诞生:4战全胜,领跑积分榜,亚马尔梅开二度,1亿天才太犀利:独造3球

足球狗说
2026-09-07 00:17:54
被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

汉史趣闻
2026-09-02 18:57:28
今天晚上正式开播!央视又一部好剧来袭,阵容可真不错

今天晚上正式开播!央视又一部好剧来袭,阵容可真不错

小邵说剧
2026-09-07 08:10:41
长江武汉段疑现驳船倾倒不明黑色固体? 武汉环保部门回应:工作人员已赴现场调查

长江武汉段疑现驳船倾倒不明黑色固体? 武汉环保部门回应:工作人员已赴现场调查

封面新闻
2026-09-07 10:50:03
少女妈炒币亏钱卖包?富贵花退圈定居香港!

少女妈炒币亏钱卖包?富贵花退圈定居香港!

八卦疯叔
2026-09-07 10:30:07
2026-09-07 11:43:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6774文章数 26904关注度
往期回顾 全部

科技要闻

OpenAI内部开卷! 头部员工一天烧掉5万元

头条要闻

批量解约107名应届大学毕业生 星宇股份公布处罚决定

头条要闻

批量解约107名应届大学毕业生 星宇股份公布处罚决定

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

张柏芝带儿子冲浪,一起看风景

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
手机
家居
公开课
军事航空

索尼《地平线3》发售计划遭曝光!杀戮地带RE之后

手机要闻

荣耀MagicPad4国行版规格曝光,搭骁龙8s Gen4处理器

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版