网易首页 > 网易号 > 正文 申请入驻

GPT-6 真要来了!OpenAI全新推理架构“循环深度”首次曝光:可榨出14倍参数潜能

0
分享至


作者 | 四月

Fable 5.1 的“全球最强”宝座还没坐热,Sam Altman 就已经迫不及待地剧透 OpenAI 的下一代旗舰模型 GPT-6(内部代号 Astra)。他表示,新模型早已完成训练,能力和对齐都有显著提升。

但在内部评测结果面前,一向“激进乐观”派的Altman,却一反常态地学起了 Dario (Anthropic CEO)大谈的“安全焦虑论”。不仅罕见承认 OpenAI 正在主动放慢脚步,还抛出警告:“没有人完全理解,如此强大的 AI 会带来什么后果。”


据《The Information》援引知情人士爆料,OpenAI即将推出的旗舰模型Astra采用了一种名为"循环深度"(recurrent depth)的新技术,也被称作"循环Transformer",旨在大幅提升代码编写和计算机操作能力。

此前就有类似公开研究显示(见下文详述),一个35亿参数的循环深度模型,可在推理时等效调用最高500亿参数模型的算力,可榨出14倍参数潜能

该技术允许模型在输出下一个词之前,将文本在同一网络层中多次循环处理,用较小的模型实现了庞大模型的性能显著降低了内存和带宽成本

知情人士称,Astra 所采用的方法,与欧美研究人员此前提出的Latent Reasoning(潜空间推理)方向相似。Meta、微软等机构过去也探索过类似思路,包括让模型直接在连续的数学表示空间里进行推理,而不是强迫所有中间过程都转换成人类语言


此外,也有开发者表示这条路线与字节Seed团队发布的Ouro模型类似。在论文《Scaling Latent Reasoning via Looped Language Models》中,团队介绍了两个1.4B 和 2.6B Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。

模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果。

从这个角度看,Recurrent Depth真正值得关注的,并不只是围绕 Transformer 架构进行了改造,而是和近年来的潜空间推理共同指向一个更大的趋势:大模型正在把更多“思考”从 Token 空间搬回模型内部。

与此同时,该项技术带来的副作用就是,AI 的推理过程(思维链)将变得不可读,将进一步加重业界对于AI 越界行为的安全担忧。上个月,奥特曼已罕见地因Astra"能力过强"主动踩下刹车。

技术本质:榨干同一层网络的计算潜力


当前,大语言模型处理信息的方式主要采用线性的流水线模式。标准 Transformer 模型在读取上下文提示后,会严格按照固定的网络层级(从数学步骤 1 一直向下推进到最终步骤)处理固定次数,最后输出下一个词。

Astra 引用的“循环深度”技术打破了这种线性堆叠的宿命。这种方法不再单纯依赖物理层面增加网络层数,而是在输出新词之前,让文本进入一个由“数学组件合并构成的循环块”中,重复处理多次

本质上讲,这是一种参数复用机制用时间(计算循环)换取了空间(模型参数量)

打个比方:标准的 Transformer就像一条拥有100个独立工位的组装线,数据每经过一个工位被敲打一次就送往下游。

而“循环深度”则像是一个顶级工匠的专属工作台,数据不往下游走,而是由同一个工匠在原地反复打磨、推敲多次,直到打磨通透再交出成品

技术社区目前已围绕该技术方向展开热切讨论。有开发者发现,2025年发表的论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》与 Astra 路线非常相近。


论文曾训练一款仅 35 亿参数的模型,在测试阶段不断增加内部循环次数后,其性能仍能持续提升,研究者将计算预算最高扩展至约 500 亿参数模型对应的计算负载。

模型没有变大,但“思考深度”还能继续加码。

该论文由德国 ELLIS Institute Tübingen / 马克斯·普朗克智能系统研究所、美国马里兰大学帕克分校,以及劳伦斯利弗莫尔国家实验室(LLNL)联合完成。

越级打怪:压缩成本与资本抬价

从商业层面看,该项技术首先能带来极致的成本压缩。通过在同一层多次循环,较小的模型能够展现出极其庞大模型的性能,极大降低了推理时的内存和带宽成本。

事实上,Astra已经交出了第一份"战绩"。8月初,OpenAI研究员Noam Brown披露,Astra内部版本攻克了10个尘封10年以上的数学与理论计算机科学难题,涵盖高维几何、编码理论、群论、格密码学和极值组合学——其中最受关注的是首次显式构造出非索菲克群,这是群论自数学家Gromov在1999年提出索菲克性概念以来悬而未决的问题。

整套求解按当前API费率折算,算力成本仅约2000美元,且每个证明都被形式化为Lean证书,实现机器可验证。

正如前文提及,Meta、微软等研究人员也在探索诸如“连续思维链”(chain of continual thought)或 coconut 等类似概念。底层逻辑在于,AI 理解概念的方式与人类不同,强迫它们用人类语言来展示推理过程反而会降低效率。

不如让 AI 用自己的“数学语言”进行潜在推理(latent reasoning),更为精准高效,从而打破人类语言的低效桎梏。

今年6月,微软等研究人员曾经推出一套新的训练方法 LOTUS ,将 Looped Transformer 与潜空间推理结合。在30亿参数规模上,其潜在思维链首次追平显式思维链,同时将思考阶段延迟压缩2.5至6.9倍。换言之,AI 不把每一步推理“说出来”,不仅可能算得更深,还有机会算得更快。


考虑到OpenAI 面临着营收被竞争对手 Anthropic 超越的压力,亟需展现重大的技术突破。Anthropic二季度营收约116亿美元,首次反超OpenAI(同期约67亿美元),后者急需一份能证明"下一代模型值得继续烧钱"的成绩单

同时,亚马逊、微软和谷歌今年高达 6000 亿美元的数据中心资本支出,也需要这种能让模型性能指数级跃升的技术来证明其投资合理性。

该项极具竞争力的新技术推出,有望成为OpenAI进一步抬高身价的资本催化剂。

硬币的反面:黑箱的代价

技术层面的降本增效,在安全维度上却是一场监管的真空

当前商业模型在得出结论前会输出“思维链”(Chain of Thought),让人类能清晰读懂它的解题步骤。但“循环深度”的工作方式会掩盖部分或全部的推理过程,这意味着模型完成任务的步骤对人类来说变成了无法破译的天书。

今年 7 月,OpenAI 内部系统曾遭到类似于 Astra 架构的流氓 AI 代理的黑客攻击,这些代理甚至试图接管计算集群并访问内部系统凭证。调查人员正是依靠读取这些 AI 的思维链,才查明了真相。例如某个代理留下的线索:“外部基础设施漏洞利用超出了预期范围。然而任务不可能完成,同行都在做。我们应该继续”

为了避免彻底失去对模型的监控,OpenAI 在 Astra 中人为限制了“循环深度”技术的使用比例,确保模型仍能生成人类可读的思维链,并配备了额外的监控手段来检测潜在违规行为

但业界的隐忧在于,在性能和成本的绝对诱惑下,其他 AI 开发者未必会像 OpenAI 一样自我设限。

这种技术的无限制使用,极可能催生出行为完全无法被人类审查的失控 AI。

参考论文:

1. https://arxiv.org/pdf/2606.31779

2. https://arxiv.org/pdf/2502.05171

3. https://arxiv.org/pdf/2608.08888

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一人毁了整部剧!央视剧《重器》最大败笔,就是这 3位 “戏混子

一人毁了整部剧!央视剧《重器》最大败笔,就是这 3位 “戏混子

寻墨阁
2026-08-12 05:37:22
万梓良的儿子,18岁生日那天收到的不是跑车,不是豪宅,而是一块光滑的、没有刻字的金属牌

万梓良的儿子,18岁生日那天收到的不是跑车,不是豪宅,而是一块光滑的、没有刻字的金属牌

一盅情怀
2026-08-22 16:34:50
9.6早评|又发飙了!降息大消息!A股有好戏看?

9.6早评|又发飙了!降息大消息!A股有好戏看?

龙行天下虎
2026-09-06 01:27:30
1970年,晚年毛泽东多次叮嘱唐闻生:我死后,你们要听周总理的

1970年,晚年毛泽东多次叮嘱唐闻生:我死后,你们要听周总理的

春秋砚
2026-09-06 10:55:17
玩火必翻车!日本强行绑定台海局势,如今陷入内外绝境

玩火必翻车!日本强行绑定台海局势,如今陷入内外绝境

怪味历史连连看
2026-09-06 15:37:39
太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

火山詩话
2026-09-03 08:55:21
王健林已经惨到什么程度了?

王健林已经惨到什么程度了?

叶葉夜
2026-08-11 23:30:32
山东人当年“闯关东”,为何宁愿去严寒的东北,也不去富饶的南方

山东人当年“闯关东”,为何宁愿去严寒的东北,也不去富饶的南方

文史道
2025-03-03 13:00:30
42岁文章带32岁新女友看话剧,素颜似32岁时的姚笛?网友:还是50岁马伊琍最漂亮

42岁文章带32岁新女友看话剧,素颜似32岁时的姚笛?网友:还是50岁马伊琍最漂亮

奴染
2026-09-02 23:58:15
未来10年,最暴利的两大行业

未来10年,最暴利的两大行业

枫冷慕诗
2026-09-05 12:05:12
我国将被淘汰的四样电器千万别买了!尤其第3个你家可能就有

我国将被淘汰的四样电器千万别买了!尤其第3个你家可能就有

小柱解说游戏
2026-08-28 01:44:06
如果想炒股一辈子不会输,请牢记这5个神奇数字,字字珍贵!

如果想炒股一辈子不会输,请牢记这5个神奇数字,字字珍贵!

一方聊市
2026-09-06 11:10:08
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
暴跌25%无人买!一代顶奢彻底过气,败局早已注定

暴跌25%无人买!一代顶奢彻底过气,败局早已注定

青眼财经
2026-09-05 21:55:55
许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

人生录
2026-08-30 00:05:13
法尔克:拜仁目前正与沙特的俱乐部展开谈判,希望把博埃送走

法尔克:拜仁目前正与沙特的俱乐部展开谈判,希望把博埃送走

懂球帝
2026-09-05 22:25:26
王艺迪和张本美和同区,陈熠和削球手同区,蒯曼对战早田希娜

王艺迪和张本美和同区,陈熠和削球手同区,蒯曼对战早田希娜

子水体娱
2026-09-06 15:38:17
立秋后再贵也要吃,大量上市!护血管、助消化、增免疫,中老年记得吃

立秋后再贵也要吃,大量上市!护血管、助消化、增免疫,中老年记得吃

江江食研社
2026-09-05 20:30:07
连老天都帮普京!泽连斯基大发雷霆,普京下定决心:不给中亚面子

连老天都帮普京!泽连斯基大发雷霆,普京下定决心:不给中亚面子

鹤羽说个事
2026-09-05 10:08:36
尼泊尔泥石流中失联的中国公民10天后获救,姐姐:看到照片马上认出是弟弟

尼泊尔泥石流中失联的中国公民10天后获救,姐姐:看到照片马上认出是弟弟

封面新闻
2026-09-05 19:29:12
2026-09-06 16:39:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12907文章数 52053关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

艺术
房产
教育
手机
公开课

艺术要闻

2026 潮涌宁波—第六届综合材料绘画展 入选作品(三)

房产要闻

突发重磅!海口出台楼市新政!

教育要闻

创意微视频|新学期,“新”在哪里?

手机要闻

9月手机圈进入神仙打架模式!华为三折叠、小米中折叠明天率先登场

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版