网易首页 > 网易号 > 正文 申请入驻

Transformer 架构瓶颈日益凸显,四大技术路线突围,谁会成为下一轮 AI 风口?

0
分享至

设置星标★关注,从此你的世界多点科学~


2017年夏天,谷歌的AI研究人员发布一篇题为《注意力就是一切》(Attention Is All You Need)的论文。文章描述了一种名为变换器或转换器(Transformer)的新型神经网络。

后来事实证明,Transformer网络在处理长序列数据,尤其是文本方面,表现十分出色。

在2026年的今天,Transformer可谓市场上所有主流大语言模型(LLM)的核心引擎。AI初创企业Subquadratic的联合创始人兼首席执行官贾斯汀·丹格尔(Justin Dangel)表示:“整个AI行业都建立在Transformer之上。它们是计算机科学史上最重要的创新之一,已经改变整个世界。”

但与此同时,Transformer技术也显露出疲态。近期大语言模型取得的诸多进展,比如围绕推理模型的开发以及模型一次性处理海量输入的能力,都不是对核心技术的顺势延展,更像是在其某些根本性缺陷上打补丁的权宜之计。

越来越多的科学家和工程师开始思考:技术如何演变?新一代AI是何种形态?我们相信,LLM本身不会消失,但未来它们将以何种方式构建而成呢?一切尚无定论。

一批初创企业争相入局,力求在现有技术前沿上开疆拓土。注定有一部分竞争者会失败,但这些后起之秀的潜力巨大,相比当下行业头部企业,反而更具竞争优势。

的网络

首先,我们要厘清现存的技术难题。Transformer的核心优势来自所谓“密集注意力”(dense attention)机制,该机制通过一系列数字来编码一段文本的语义。处理过程中,文本里的每一个词(word),或是词的一部分,即词元(token),都会通过乘法运算与其余所有词或词元做比较。

密集注意力机制能以极高精度捕捉文本含义。但随着文本长度增加,处理所需的计算量会急剧攀升。一份长达一万个英文单词的文档,可能要求Transformer完成5000万次乘法运算。这正是大语言模型能耗巨大的主要原因。

算力成本十分高昂。据OpenAI总裁格雷格·布罗克曼(Greg Brockman)透露,OpenAI今年的算力支出将达到500亿美元。国际能源署预测,到2030年,数据中心的总耗电量将翻一番。

更糟糕的是,处理面对诸多新模型所须完成的任务,Transformer网络往往力不从心。受逐词处理文本的工作方式限制,Transformer不擅长同时维护大量信息,换言之,它的上下文窗口无法扩展得太大。

然而,LLM若要开展难度更高的任务,就必须接收更大规模的数据,比如一整套文档库、一整个代码库,或是来自其他大语言模型的输出结果。

推理模型的工作方式是先借助思维链这一草稿本来给自己写笔记,再读取笔记继续推理。这种方式也会增加模型需要维护的数据体量。

随着LLM不断变大变强,Transformer的瓶颈越发凸显。它们曾经的核心优势,如今却成局限性。

下文介绍四种旨在解决Transformer网络局限性的新思路。这些创新有望彻底重塑大语言模型,使其速度更快、效率大幅提升,或许还可越发智能。

路线01

重新设计注意力机制

要让大语言模型跑得更快、成本更低,不妨直击痛点,改变注意力机制,用稀疏注意力(sparse attention)替代密集注意力。

稀疏注意力机制仅对文本块中的部分词对进行运算,而非全部。这可以大幅减少LLM所需的计算量。

多年来,研究人员提出过大量稀疏注意力机制,但它们在捕捉语义方面始终比不上密集注意力机制。当然,今时或已不同往日。

前文提到的初创企业Subquadratic宣称,他们开发的一款稀疏注意力机制,首次在搜索、代码生成等多项任务上展现了对标主流顶尖LLM的性能。此论断可谓重磅,不过业内部分人士仍持怀疑态度。

Subquadratic方面表示,自家模型SubQ会针对输入文本的每一段,实时判断哪些词重要或不重要。据称,有数以万计的用户报名加入等待名单,以求试用SubQ;而该模型向全体公众开放的日子也会很快到来。

另一家初创企业Manifest AI则另辟蹊径,选择不改造注意力机制的工作方式,直接用全新方案取而代之。

这家公司开发出一套名为“幂保留”(power retention)的机制。幂保留机制仅保存与当前任务最为相关的信息,从而确保大模型需要维护的数据量不会爆炸式增长。

传统注意力机制要求LLM记住上下文窗口内的全部内容。以SubQ为代表的稀疏注意力模型虽舍弃了大量单个词,却仍保留其所见内容的概貌。相比之下,幂保留机制会为模型提供一个关于上下文窗口内容,也就是模型当前能看到的所有文本内容的滚动摘要——若有新增信息进入,相关性较低的旧信息即被丢弃。

幂保留的基本原理已存在约十年之久。Manifest AI方面声称:他们完成了技术迭代,首次构建出可比肩基于Transformer的大模型的产品。另外,仅需少量再训练,即可将Transformer模型改造为幂保留模型。

为证明上述改造能力,技术团队将现有开源代码大模型StarCoder调整为搭载幂保留机制的PowerCoder,还发布了Brumby模型,称其性能可匹敌阿里通义千问的某些版本。

Manifest AI的愿景是:当大语言模型需要处理海量数据任务时,幂保留技术能成为首选方案。公司联合创始人兼首席技术官卡莱斯·赫拉达(Carles Gelada)曾表示,他们的技术方案拥有广阔应用场景,小到分析数小时时长的视频,大到打造能连续数周执行任务的AI智能体。

路线02

打造体积更小巧、更灵活的模型

由麻省理工学院孵化的初创企业Liquid AI并未彻底修改或是舍弃Transformer,而是将其自研的液态神经网络(liquid neural networks)与Transformer结合,构建出所谓的“液态基础模型”(liquid foundation models),简称LFM。

Liquid AI的模型体量远小于绝大多数LLM,能耗也更低。公司已为梅赛德斯等车企开发适配车载小型芯片的模型;其最新版本甚至可在售价50美元、低功耗的树莓派开发板上运行。

据称,年收入低于1000万美元的企业可免费使用Liquid AI的产品,而模型下载量已达数千万次,且广受好评。

液态神经网络是卷积神经网络的延伸,其灵感源自蠕虫大脑;卷积神经网络则是Transformer诞生前就已存在的另一类神经网络。液态神经网络之所以脱颖而出,关键在于有一套自适应机制,使模型能根据新信息动态调整自身行为,实现边运行边学习。基于Transformer的模型则无此能力,一旦训练完成,其行为模式就固定不变。

Liquid AI的早期模型虽相对基础,但已能操控无人机、驾驶车辆。如今借助液态基础模型,公司正尝试将技术规模化,以对标主流大语言模型。新模型的性能可匹敌在规模上4倍于自己的竞品,包括阿里通义千问和谷歌开源大模型Gemma的某些版本。

典型的LLM由多个Transformer堆叠搭建而成。Liquid AI最新的LFM属于混合架构,包含20%的Transformer与80%的液态神经网络。

计算出上述配比的并非人类,而是该公司自研的另一套AI系统——专用于辅助模型设计。据称,这套能设计AI的AI会把各种不同神经网络,如液态网络、卷积网络、Transformer等进行大量组合,并筛选组合方案,找到性能与效率的最佳平衡点。

Liquid AI的联合创始人兼首席执行官拉明·哈萨尼(Ramin Hasani)认为神经网络的未来充满无限可能,Transformer只是开端而已。

“人类大脑就个是通用人工智能系统,其功耗却只有20瓦。这是怎么实现的?我们完全能做出更多创新。”

——拉明·哈萨尼

路线03

一次性生成全部文本

几乎所有大语言模型都逐词输出内容。这符合人类说话写作的习惯,但对计算机而言效率极低。若LLM能一次性生成文本——一口气吐出整句乃至整段——速度和成本都将得到优化。

上述思路的践行者之一Inception公司,正利用扩散技术来构建大模型。

扩散技术更为人熟知的角色,是绝大多数图像、视频生成模型的驱动核心。扩散大模型的训练方式则是:先接收一个随机的像素网格(类似老式电视机的雪花噪点),再同时处理全部像素,判断哪些像素需要修改,把雪花噪点变成一幅高清图像。

事实证明,上述流程同样适用文本。Inception团队通过特定训练,使扩散大模型能接收一串随机的词语序列并转化为语义通顺的句子。这种扩散LLM仍使用Transformer来编码语义,但会一次性输出整块文本,以更少代价完成更多任务。

公司联合创始人兼首席执行官斯特凡诺·埃尔蒙(Stefano Ermon)表示,自家的创新依旧属于大型Transformer模型,但它能同时预测多个词元。这就是为什么,对比市场上绝大多数方案,这套模型的文本生成速度快很多,成本效益更高。

其中的难点在于,怎样把原本为图像生成所设计的技术迁移至文本领域。

“处理图像时,把一个蓝色像素改成红色像素,可经过中间过渡颜色逐步调整。但文本不行,‘猫’与‘狗’之间没有中间词汇。”

——斯特凡诺·埃尔蒙

埃尔蒙的另一重身份是斯坦福大学研究员。2024年,他与两名斯坦福同事找到了弥合文本鸿沟的数学方法,并以此为基础训练出一款适配文本的扩散模型,其性能媲美2019年OpenAI发布的GPT‑2,生成速度则快10倍。

基于该项成果,埃尔蒙创办Inception。眼下,他的雄心指向行业头部。Inception称其最新模型Mercury 2性能对标2023年OpenAI发布的部分GPT‑4版本,速度同样快10倍。

“我们非常看好这条路线,它具备规模化扩展的潜力。归根到底,速度与成本是衡量大模型价值的核心标准——你向它投入一块钱后能获得多少智能?”

——斯特凡诺·埃尔蒙

押注扩散技术的企业不只Inception一家。谷歌方面也正积极尝试,并已打造名为Diffusion Gemma的原型LLM。

路线04

干脆跳出文本世界

在围绕Transformer局限性探索创新方案的初创企业里,Pathway公司的理念最具颠覆性。他们想让大语言模型摆脱语言的束缚,并以此为目标开发了Dragon Hatchling大模型。

迄今为止,它最亮眼的成绩来自一项与超过25万多道超高难度数独题对战的基准测试。多家顶尖实验室的主流大模型难以破解哪怕一道谜题,Dragon Hatchling却攻克了97%以上的难关。

Pathway想传递的观点是:主流LLM虽在大量任务上表现出众,但仍对诸多关键类型的问题无能为力,数独只是其中一例。

公司联合创始人兼首席执行官祖赞娜·斯塔米罗夫斯卡(Zuzanna Stamirowska)表示,若要大模型针对现实问题产出真正原创的解决方案,就必须跳出Transformer框架。因为Transformer迫使大模型全部依靠文本完成推理,但语言并非某些推理形式的最优载体。

Pathway的解决方案是修改Transformer的底层数学逻辑,用“状态空间”(state space)这一数学结构替代注意力机制。

状态空间不再逐词编码信息,而是将信息压缩为更抽象的表达。以此为基础,Dragon Hatchling依旧能读写文本,同时也可模拟不依赖词语序列的推理模式。这不仅提升模型效率,理论上还可胜任其他LLM力不能及的任务。

“国际象棋和数学问题,并非以长句形式存在于人类脑中。大脑灵光一闪的顿悟,未必以语言形式出现。我们认为,若推理必须依托语言完成,这本身就是一种局限。主流LLM有能力阅读数独解题教程,再编写求解代码,但这并非我们所求,我们理想中的模型不局限于书本知识。

AI的星辰大海不是解数独题,而是攻克癌症——可这世上还没有一本现成的癌症解法手册。”

——祖赞娜·斯塔米罗夫斯卡

资料来源:


《世界科学》杂志版在售中 欢迎订阅

月刊定价

15元/期

全年订阅价

180元

点击左侧图片或以下方订阅方式选购

方式一

扫描二维码,“杂志铺”(第三方平台)订阅有折扣~

方式二

全国各地邮局订阅 邮发代号:4-263

方式三

机构订阅,请拨打

021-53300839;

021-53300838

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中央纪委、财政部通报!六起地方政府隐性债务追责问责案例涉资超68亿元

中央纪委、财政部通报!六起地方政府隐性债务追责问责案例涉资超68亿元

环球网资讯
2026-09-11 16:11:08
中国驻日本大使馆:根据签证费对等安排,自9月14日起对日本公民赴华签证规费进行调整,一次签证收费16750日元

中国驻日本大使馆:根据签证费对等安排,自9月14日起对日本公民赴华签证规费进行调整,一次签证收费16750日元

上观新闻
2026-09-11 14:49:35
超63万人预约15999元iPhone Duo,有“黄牛”标价9.9万元代抢......

超63万人预约15999元iPhone Duo,有“黄牛”标价9.9万元代抢......

掌上春城
2026-09-10 23:37:03
上海体育局给了刘翔多项选择,名记:每个职位都不错但他一个都没看上,旧日情分恐到此为止

上海体育局给了刘翔多项选择,名记:每个职位都不错但他一个都没看上,旧日情分恐到此为止

尘语者
2026-09-11 09:22:16
气愤!山东泰山球迷恶意调侃青岛火灾 道歉也没用 警方做出回应

气愤!山东泰山球迷恶意调侃青岛火灾 道歉也没用 警方做出回应

念洲
2026-09-11 14:52:42
3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

kio鱼
2026-09-11 00:16:11
虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

红豆讲堂
2025-01-15 10:49:37
我们不是快船!13号只属于哈登,火箭队记明牌了,已拒绝所有请求

我们不是快船!13号只属于哈登,火箭队记明牌了,已拒绝所有请求

体育火锅T
2026-09-11 14:13:52
名古屋亚运会主火炬还没点燃,1274人的中国代表团先撞上四道坎——史上首个不建亚运村的亚运会,四千多人挤邮轮、两千多人住集装箱;

名古屋亚运会主火炬还没点燃,1274人的中国代表团先撞上四道坎——史上首个不建亚运村的亚运会,四千多人挤邮轮、两千多人住集装箱;

回京历史梦
2026-09-11 17:34:26
耐人寻味!一段车间裸奔视频全网发酵,瑞浦兰钧风波,远不止网传那般简单

耐人寻味!一段车间裸奔视频全网发酵,瑞浦兰钧风波,远不止网传那般简单

火山詩话
2026-09-11 05:50:16
坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

叶老四
2026-09-09 13:55:36
美剧神作排行榜

美剧神作排行榜

喜欢历史的阿繁
2026-09-11 00:50:02
突发!曝知名港星雷宇扬去世,享年62岁曝最后露面照,小21岁娇妻马荔正式噩耗

突发!曝知名港星雷宇扬去世,享年62岁曝最后露面照,小21岁娇妻马荔正式噩耗

裕丰娱间说
2026-09-11 16:04:49
下午3点!CCTV5直播男篮冲击两连胜,王俊杰迎复出 赢球=小组出线

下午3点!CCTV5直播男篮冲击两连胜,王俊杰迎复出 赢球=小组出线

麦子的篮球故事
2026-09-11 14:26:52
黄金,直线拉升

黄金,直线拉升

鲁中晨报
2026-09-11 14:59:25
韩国前第一夫人金建希请求无罪判决:丈夫尹锡悦成为总统后,我失去一切财富和声誉,"婚前经营企业时,我的经济状况要好得多"

韩国前第一夫人金建希请求无罪判决:丈夫尹锡悦成为总统后,我失去一切财富和声誉,"婚前经营企业时,我的经济状况要好得多"

鲁中晨报
2026-09-11 14:31:04
罕见!希拉里·克林顿出来谈台湾问题了!

罕见!希拉里·克林顿出来谈台湾问题了!

果妈聊娱乐
2026-09-11 11:28:54
第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

真的好爱你
2026-09-10 18:48:38
随着高芙1-2遭逆转,美网女单决赛2席全部诞生:世界前二霸榜

随着高芙1-2遭逆转,美网女单决赛2席全部诞生:世界前二霸榜

侧身凌空斩
2026-09-11 11:08:57
种植户给香蕉地喷3天农药,毒死隔壁5万斤牛蛙,法院:蕉农在双方共同取水口兑药,蛙农未检测水质也存在过错,自担3成,获赔33.9万元

种植户给香蕉地喷3天农药,毒死隔壁5万斤牛蛙,法院:蕉农在双方共同取水口兑药,蛙农未检测水质也存在过错,自担3成,获赔33.9万元

潇湘晨报
2026-09-11 16:49:53
2026-09-11 18:36:49
世界科学 incentive-icons
世界科学
《世界科学》编辑部运营账号
1951文章数 26958关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

健康
旅游
房产
手机
亲子

手脚发麻口齿不清?也可能是中风!

旅游要闻

文化中国行·长江文化探访丨龙兴古镇焕新引多元业态 将打造古装短视频拍摄基地

房产要闻

时隔7年,绿地海南再拿地!

手机要闻

网友调侃iPhone 18系列发布:iPhone都已成年了 我还在用正太苹果

亲子要闻

经济拮据,全职宝妈鼓起勇气出来找工作!找到满意岗位却陷入两难:伸手找老公拿家用,还是出门挣工资?

无障碍浏览 进入关怀版