网易首页 > 网易号 > 正文 申请入驻

阿莫迪偷师姚顺雨,奥特曼偷师梁文锋

0
分享至



正所谓天下文章一大抄,看你会抄不会抄。

刚刚发布的Opus 5.5和GPT-6 Luna,一眼望去,这两个模型上面满满是姚顺雨和梁文锋的影子。

或许是因为两家公司都已经将预训练做到了极致,为了提升模型的智能以及降低算力成本,所以这两个新模型都选择开辟新的战场。

Opus 5.5是对上下文动手,GPT-6 Luna是对缓存动手。

这我可熟啊!一个混元,一个DeepSeek啊!

但你别说,阿莫迪和奥特曼还真抄得挺像那么回事。

01

阿莫迪偷师姚顺雨

先看一组数字,Artificial Analysis的智能指数里,有一项统计是“跑完一道题平均要输出多少token”。

在这张榜单上,Claude Opus 5.5在max档位下,平均每题要吐出11.9万个输出token,其中8.4万个是“思考”,3.5万个是最终答案。而OpenAI的GPT-6 Astra,在同一档位下只用了2.7万个 token。

大模型想要提升模型的智能水平,传统路线是在预训练阶段堆数据、堆算力,把智力放进模型的权重里,一次训练、反复使用。

这条路线的模型在推理时几乎不做额外思考。模型训练时数据价值越高,模型的智能水平就越高。

但传统路线就怕出现没见过的题型,传统模型的泛化是插值。在训练数据覆盖的分布附近,它表现很好。一旦碰到没见过的题型,或者需要多步推理的题,它就开始瞎编。因为它的“智力”全在权重里,权重没见过的模式,它推理时也补不出来。

就像你对着木桩练了很久的拳法,结果发现上了战场以后,对方不会站着不动,而且还会使用武器。

另一条是test-time路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理,想得越久、答得越好。智力不再只来自权重,还来自于每次调用时现场的推理。

换句话说,智力被搬进了上下文。

Opus 5.5走的就是test-time路线。



官方有这么一条声明:除非特别注明,所有成绩都跑在“adaptive thinking at max effort”(最大力度的自适应思考)下。

而且从这一代开始,Opus 5.5不再提供“关闭thinking模式”的选项。变相就是在说,推理过程就是模型的一部分。

代价就是思考过程会消耗更多token,成本也会随任务难度飙升。Opus 5.5的核心逻辑是,该训练的数据都训练得差不多了,预训练边际收益见顶,因此智能的增量只能从推理里找。

这种从上下文中找智能的逻辑,姚顺雨很早就提出来过。

2023年,姚顺雨提出Tree of Thoughts(思维树)这个概念,其本质就是一种test-time。

推理时展开多条思路,边想边搜索最优解。

同一年,他还提出了ReAct架构,让模型“推理”和“行动”交替进行。

2025年4月,姚顺雨发表博客《The Second Half》。

文章的核心判断是,AI的上半场,拼的是“训练方法与模型”,比如更大的参数、更多的数据、更强的算力。到了下半场,拼的是“如何使用与评估模型”,增量正在从“训练”挪到“推理与行动”。

他在文中写到,“把推理放进动作空间之后,我们才获得了‘针对不同决策灵活分配test-time compute(推理时算力)’”的能力。

姚顺雨把“思考”称作一种“奇怪的动作”。

RL里的动作是用来改变环境的,比如打开一个箱子,那么箱子的状态就会发生改变。动作的意义,就在于“让世界发生变化,从而换来奖励”。

但思考不会,即使想了一万遍,箱子也不会自己打开。

姚顺雨在文章中举了个例子,说有两个盒子,一个有100万美元、一个空的,这时候,期望收益就是50万。

现在往里塞进无数个空盒子,期望收益就会越来越低,因为要从无穷多个盒子里挑那个100万美元的盒子。

然而,如果把“推理”这个动作加进去之后,模型反而更强了,会更容易选中那个100万美元的盒子。

姚顺雨的解释是,那些“空盒子”,你在生活里以及各种游戏里都见过。挑选它们的过程本身,就是在为“选中那个装钱的盒子”做准备。

Opus 5.5,就是把姚顺雨的这个理念给工程实现了。

02

奥特曼偷师梁文锋

如果说Opus 5.5的重点是“怎么想”,那GPT-6 Luna的重点就是“怎么便宜地想”。

GPT-6 Luna输入0.1美元/百万token、输出0.5美元/百万token,比上一代GPT-5.6 Luna直接砍半。

如果缓存命中,那么读一次缓存的价格是0.01美元/百万token,比标准输入价便宜90%。

模型的每一次调用,都要把你给它的全部上下文“读一遍”。比如系统提示、长文档、历史对话,一个字都不能少。

但是这段上下文,重复度极高。Agent每多走一步,前面那一大坨都要重读一遍。长上下文,就成了烧钱的黑洞。

GPT-6 Luna使用的缓存复用(prompt caching/KV cache复用),它所要解决的就是这件事。同一段上下文,算过一次就存起来,下次直接“读缓存”、不重算。于是“重复的那部分”,从最贵变成了最便宜。

但这套动作,DeepSeek早就做过了。

2026年8月2日,DeepSeek上线“Context Caching on Disk”(磁盘上下文缓存),把重复内容缓存在磁盘阵列上,命中时直接取用、跳过重算。

当时公告写着,缓存命中价砍到0.1元/百万token,比未命中便宜正好也是90%,和GPT-6 Luna一样。

到了V4 Flash这里,命中0.02元、未命中1元,差50倍。

GPU显存非常贵,所以能存的KV cache容量有限。但是硬盘很便宜,并且容量大,将KV cache存进去以后成本会大大降低。

OpenAI现在做的prompt caching和DeepSeek原理几乎相同,同一段前缀算过一次存起来,下次直接读。



不止价格,还有架构。

GPT-6 Luna的上下文窗口是105万token,DeepSeek V4是100万token,两边几乎对齐。

但是,100万上下文的KV cache,按标准注意力机制来算,一半的模型根本扛不住。

为此,DeepSeek使用了MLA架构,把Key和Value联合压缩进一个低维潜空间,缓存那个潜向量、用时再上采样还原。

DeepSeek-V2的技术报告里提到,MLA把KV cache砍掉了93.3%,生成吞吐提升到5.76倍。到了V4,又叠上压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token上下文下,KV cache只有上一代V3.2的10%。

除此以外,OpenAI还“偷师”了一招:推测解码。

OpenAI在官方博客里说,他们跑一个更小的draft(草稿)模型,让它和主模型并行地“猜”接下来几个 token,主模型再批量验收。

猜对了,一次前向就能吐好几个token。OpenAI官方表示,这一项改进让token生成效率提升了15%以上。

这个思路在2024年的DeepSeek V3里就有了,DeepSeek使用的是MTP(Multi-Token Prediction,多token预测)。

其做法是在主干模型后面直接挂一个MTP头,训练时和主干一起训,共享主干的hidden state。推理时这个头知道主模型内部状态长什么样,猜得准、验收通过率高。

这个头可以直接丢掉不影响主干,也可以留着当草稿机。

OpenAI相当于是外挂了一个独立的小模型去打草稿。两个模型各跑各的,草稿不知道主模型在想什么,只是猜完由主模型验收。

虽然方法不太一样,但是两者的思想是同一个。小的先猜、大的批量验,把串行解码变并行。

03

天下文章一大抄

以前,定义模型的是硅谷,国内AI公司因为算力有限,所以会把这些定义转换成更便宜的解决办法。

这一轮,反过来了。学术范式和工程范式,都是中国公司做的。

美国的巨头们则负责最后一步,把它做成产品,卖给全世界。

过去几年,大厂的资源、人才、注意力全部all in在预训练这个主战场上。

大家根据Scaling Law来堆数据、堆算力、刷榜单。可头部公司都陷入了前文提到的,Anthropic如今的窘境,优质数据几乎全部训练完成,模型预训练边际收益递减。

那么这时,行业的增量自然而然就会出现在第二战场,比如推理时怎么想(test-time compute)、上下文怎么用(context learning)、长上下文怎么便宜(caching/MLA/稀疏注意力)。

这就好比武林里,大门派花了几十年练一门功夫。练着练着就发现,武功练到一定程度就不涨了,反而以前那些不起眼的“旁门左道”更能提高功力。



这里还有个反直觉的地方,主战场上的优势,到了第二战场,反而成了“累赘”。

手里攥着最多算力和数据的一方,恰恰最没动力去抠成本、抠效率。头部公司已经形成了“反正我堆卡就能解决问题,何必费劲去想更聪明的办法?”的想法。这就导致省显存、省钱这件事,从一开始就不是他们的议题,甚至有点“掉价”。

只有算力吃紧的一方,才会把每一分钱都花在刀刃上。

DeepSeek的MLA、磁盘缓存、稀疏注意力,本质上都是“穷则思变”。

当年它们只是“没钱的替代方案”,是没办法的办法。可真到全行业开始拼效率的时候,这些“土办法”忽然成了最硬的通货。

于是才会出现国外“偷师”国内的现状。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
两性心理学:同房时真正生理性喜欢,不是接吻,不是拥抱,而是这种感觉

两性心理学:同房时真正生理性喜欢,不是接吻,不是拥抱,而是这种感觉

心理观察局
2026-09-14 06:16:07
北大法学院教授赵宏再曝雷人言论:过度反诈,正在让反诈失去原本意义?

北大法学院教授赵宏再曝雷人言论:过度反诈,正在让反诈失去原本意义?

小徐讲八卦
2026-09-24 11:57:16
李乐成、王东伟看望正省级老同志

李乐成、王东伟看望正省级老同志

政知新媒体
2026-09-25 21:47:45
韩媒:中国队单日32金太夸张,美国队来参加都拿不了这么多

韩媒:中国队单日32金太夸张,美国队来参加都拿不了这么多

凉了时光人
2026-09-25 15:07:57
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

西楼知趣杂谈
2026-09-22 20:06:45
又被美拒签!巴勒斯坦总统在联大隔空谴责以色列

又被美拒签!巴勒斯坦总统在联大隔空谴责以色列

看看新闻Knews
2026-09-25 13:07:17
重磅!北京楼市政策重大调整,房价大局已定

重磅!北京楼市政策重大调整,房价大局已定

专业聊房君
2026-09-25 15:07:29
抖音内部多人被抓,事情闹大了!

抖音内部多人被抓,事情闹大了!

互联网品牌官
2026-09-24 15:02:39
价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

XCiOS俱乐部
2026-09-23 20:44:19
特朗普亲自接机,最破防的是日本!

特朗普亲自接机,最破防的是日本!

环球策论
2026-09-24 19:11:15
解放军放出重磅消息!据国防部通报,9月22日到25日,中方将派出部队前往印尼,参与东盟防长扩大会框架下的“三叉戟决心”实兵演练。

解放军放出重磅消息!据国防部通报,9月22日到25日,中方将派出部队前往印尼,参与东盟防长扩大会框架下的“三叉戟决心”实兵演练。

回京历史梦
2026-09-23 11:18:23
特朗普:感谢你们进行这一次具有历史意义的访问

特朗普:感谢你们进行这一次具有历史意义的访问

澎湃新闻
2026-09-25 03:23:02
厚度才4.8毫米!这块超薄国产表有点东西

厚度才4.8毫米!这块超薄国产表有点东西

腕表天地
2026-09-24 07:55:48
12306增设亲子候补不同车厢弹窗提示获赞,网友:建议增加“等待连座”选项,确保大人孩子座位相邻;12306回应

12306增设亲子候补不同车厢弹窗提示获赞,网友:建议增加“等待连座”选项,确保大人孩子座位相邻;12306回应

极目新闻
2026-09-25 14:57:09
小偷正在“饿死”!全国盗抢骗案件下降38.9%,原因竟不是摄像头

小偷正在“饿死”!全国盗抢骗案件下降38.9%,原因竟不是摄像头

猫叔东山再起
2026-09-24 10:55:19
苏群:国乒因为饭圈影响了高水平!中国男篮是因为水平低才有了饭圈

苏群:国乒因为饭圈影响了高水平!中国男篮是因为水平低才有了饭圈

念洲
2026-09-25 07:00:13
每天一片甲钴胺,一个月后身体可能出现这4个变化

每天一片甲钴胺,一个月后身体可能出现这4个变化

芹姐说生活
2026-09-25 15:35:56
“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

蝴蝶花雨话教育
2026-09-24 00:05:17
意媒:劳塔罗以一身运动又不失优雅的造型现身阿足协训练中心

意媒:劳塔罗以一身运动又不失优雅的造型现身阿足协训练中心

懂球帝
2026-09-24 23:11:15
2026-09-25 22:19:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2806文章数 8094关注度
往期回顾 全部

头条要闻

小伙记录母亲离世最后14天 母亲曾称"太痛苦了回家吧"

头条要闻

小伙记录母亲离世最后14天 母亲曾称"太痛苦了回家吧"

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

定居温哥华,59岁王祖贤首谈退圈真相

财经要闻

月饼卖不动了...

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

汽车要闻

小鹏G9L VS 保时捷卡宴,同场实测讲解

态度原创

教育
手机
旅游
公开课
军事航空

教育要闻

破防了!“三首一工” 生源校揭秘!牛校扎堆,普娃天花板又升了

手机要闻

华为麒麟9035芯片本月登场:Mate 90 Pro首发搭载

旅游要闻

金山朱泾千年花灯会中秋启幕,双节文旅盛宴持续至10月7日

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

联大伊朗代表席摆着苏莱曼尼遗像

无障碍浏览 进入关怀版