网易首页 > 网易号 > 正文 申请入驻

Transformer 架构瓶颈日益凸显,四大技术路线突围,谁会成为下一轮 AI 风口?

0
分享至

设置星标★关注,从此你的世界多点科学~


2017年夏天,谷歌的AI研究人员发布一篇题为《注意力就是一切》(Attention Is All You Need)的论文。文章描述了一种名为变换器或转换器(Transformer)的新型神经网络。

后来事实证明,Transformer网络在处理长序列数据,尤其是文本方面,表现十分出色。

在2026年的今天,Transformer可谓市场上所有主流大语言模型(LLM)的核心引擎。AI初创企业Subquadratic的联合创始人兼首席执行官贾斯汀·丹格尔(Justin Dangel)表示:“整个AI行业都建立在Transformer之上。它们是计算机科学史上最重要的创新之一,已经改变整个世界。”

但与此同时,Transformer技术也显露出疲态。近期大语言模型取得的诸多进展,比如围绕推理模型的开发以及模型一次性处理海量输入的能力,都不是对核心技术的顺势延展,更像是在其某些根本性缺陷上打补丁的权宜之计。

越来越多的科学家和工程师开始思考:技术如何演变?新一代AI是何种形态?我们相信,LLM本身不会消失,但未来它们将以何种方式构建而成呢?一切尚无定论。

一批初创企业争相入局,力求在现有技术前沿上开疆拓土。注定有一部分竞争者会失败,但这些后起之秀的潜力巨大,相比当下行业头部企业,反而更具竞争优势。

的网络

首先,我们要厘清现存的技术难题。Transformer的核心优势来自所谓“密集注意力”(dense attention)机制,该机制通过一系列数字来编码一段文本的语义。处理过程中,文本里的每一个词(word),或是词的一部分,即词元(token),都会通过乘法运算与其余所有词或词元做比较。

密集注意力机制能以极高精度捕捉文本含义。但随着文本长度增加,处理所需的计算量会急剧攀升。一份长达一万个英文单词的文档,可能要求Transformer完成5000万次乘法运算。这正是大语言模型能耗巨大的主要原因。

算力成本十分高昂。据OpenAI总裁格雷格·布罗克曼(Greg Brockman)透露,OpenAI今年的算力支出将达到500亿美元。国际能源署预测,到2030年,数据中心的总耗电量将翻一番。

更糟糕的是,处理面对诸多新模型所须完成的任务,Transformer网络往往力不从心。受逐词处理文本的工作方式限制,Transformer不擅长同时维护大量信息,换言之,它的上下文窗口无法扩展得太大。

然而,LLM若要开展难度更高的任务,就必须接收更大规模的数据,比如一整套文档库、一整个代码库,或是来自其他大语言模型的输出结果。

推理模型的工作方式是先借助思维链这一草稿本来给自己写笔记,再读取笔记继续推理。这种方式也会增加模型需要维护的数据体量。

随着LLM不断变大变强,Transformer的瓶颈越发凸显。它们曾经的核心优势,如今却成局限性。

下文介绍四种旨在解决Transformer网络局限性的新思路。这些创新有望彻底重塑大语言模型,使其速度更快、效率大幅提升,或许还可越发智能。

路线01

重新设计注意力机制

要让大语言模型跑得更快、成本更低,不妨直击痛点,改变注意力机制,用稀疏注意力(sparse attention)替代密集注意力。

稀疏注意力机制仅对文本块中的部分词对进行运算,而非全部。这可以大幅减少LLM所需的计算量。

多年来,研究人员提出过大量稀疏注意力机制,但它们在捕捉语义方面始终比不上密集注意力机制。当然,今时或已不同往日。

前文提到的初创企业Subquadratic宣称,他们开发的一款稀疏注意力机制,首次在搜索、代码生成等多项任务上展现了对标主流顶尖LLM的性能。此论断可谓重磅,不过业内部分人士仍持怀疑态度。

Subquadratic方面表示,自家模型SubQ会针对输入文本的每一段,实时判断哪些词重要或不重要。据称,有数以万计的用户报名加入等待名单,以求试用SubQ;而该模型向全体公众开放的日子也会很快到来。

另一家初创企业Manifest AI则另辟蹊径,选择不改造注意力机制的工作方式,直接用全新方案取而代之。

这家公司开发出一套名为“幂保留”(power retention)的机制。幂保留机制仅保存与当前任务最为相关的信息,从而确保大模型需要维护的数据量不会爆炸式增长。

传统注意力机制要求LLM记住上下文窗口内的全部内容。以SubQ为代表的稀疏注意力模型虽舍弃了大量单个词,却仍保留其所见内容的概貌。相比之下,幂保留机制会为模型提供一个关于上下文窗口内容,也就是模型当前能看到的所有文本内容的滚动摘要——若有新增信息进入,相关性较低的旧信息即被丢弃。

幂保留的基本原理已存在约十年之久。Manifest AI方面声称:他们完成了技术迭代,首次构建出可比肩基于Transformer的大模型的产品。另外,仅需少量再训练,即可将Transformer模型改造为幂保留模型。

为证明上述改造能力,技术团队将现有开源代码大模型StarCoder调整为搭载幂保留机制的PowerCoder,还发布了Brumby模型,称其性能可匹敌阿里通义千问的某些版本。

Manifest AI的愿景是:当大语言模型需要处理海量数据任务时,幂保留技术能成为首选方案。公司联合创始人兼首席技术官卡莱斯·赫拉达(Carles Gelada)曾表示,他们的技术方案拥有广阔应用场景,小到分析数小时时长的视频,大到打造能连续数周执行任务的AI智能体。

路线02

打造体积更小巧、更灵活的模型

由麻省理工学院孵化的初创企业Liquid AI并未彻底修改或是舍弃Transformer,而是将其自研的液态神经网络(liquid neural networks)与Transformer结合,构建出所谓的“液态基础模型”(liquid foundation models),简称LFM。

Liquid AI的模型体量远小于绝大多数LLM,能耗也更低。公司已为梅赛德斯等车企开发适配车载小型芯片的模型;其最新版本甚至可在售价50美元、低功耗的树莓派开发板上运行。

据称,年收入低于1000万美元的企业可免费使用Liquid AI的产品,而模型下载量已达数千万次,且广受好评。

液态神经网络是卷积神经网络的延伸,其灵感源自蠕虫大脑;卷积神经网络则是Transformer诞生前就已存在的另一类神经网络。液态神经网络之所以脱颖而出,关键在于有一套自适应机制,使模型能根据新信息动态调整自身行为,实现边运行边学习。基于Transformer的模型则无此能力,一旦训练完成,其行为模式就固定不变。

Liquid AI的早期模型虽相对基础,但已能操控无人机、驾驶车辆。如今借助液态基础模型,公司正尝试将技术规模化,以对标主流大语言模型。新模型的性能可匹敌在规模上4倍于自己的竞品,包括阿里通义千问和谷歌开源大模型Gemma的某些版本。

典型的LLM由多个Transformer堆叠搭建而成。Liquid AI最新的LFM属于混合架构,包含20%的Transformer与80%的液态神经网络。

计算出上述配比的并非人类,而是该公司自研的另一套AI系统——专用于辅助模型设计。据称,这套能设计AI的AI会把各种不同神经网络,如液态网络、卷积网络、Transformer等进行大量组合,并筛选组合方案,找到性能与效率的最佳平衡点。

Liquid AI的联合创始人兼首席执行官拉明·哈萨尼(Ramin Hasani)认为神经网络的未来充满无限可能,Transformer只是开端而已。

“人类大脑就个是通用人工智能系统,其功耗却只有20瓦。这是怎么实现的?我们完全能做出更多创新。”

——拉明·哈萨尼

路线03

一次性生成全部文本

几乎所有大语言模型都逐词输出内容。这符合人类说话写作的习惯,但对计算机而言效率极低。若LLM能一次性生成文本——一口气吐出整句乃至整段——速度和成本都将得到优化。

上述思路的践行者之一Inception公司,正利用扩散技术来构建大模型。

扩散技术更为人熟知的角色,是绝大多数图像、视频生成模型的驱动核心。扩散大模型的训练方式则是:先接收一个随机的像素网格(类似老式电视机的雪花噪点),再同时处理全部像素,判断哪些像素需要修改,把雪花噪点变成一幅高清图像。

事实证明,上述流程同样适用文本。Inception团队通过特定训练,使扩散大模型能接收一串随机的词语序列并转化为语义通顺的句子。这种扩散LLM仍使用Transformer来编码语义,但会一次性输出整块文本,以更少代价完成更多任务。

公司联合创始人兼首席执行官斯特凡诺·埃尔蒙(Stefano Ermon)表示,自家的创新依旧属于大型Transformer模型,但它能同时预测多个词元。这就是为什么,对比市场上绝大多数方案,这套模型的文本生成速度快很多,成本效益更高。

其中的难点在于,怎样把原本为图像生成所设计的技术迁移至文本领域。

“处理图像时,把一个蓝色像素改成红色像素,可经过中间过渡颜色逐步调整。但文本不行,‘猫’与‘狗’之间没有中间词汇。”

——斯特凡诺·埃尔蒙

埃尔蒙的另一重身份是斯坦福大学研究员。2024年,他与两名斯坦福同事找到了弥合文本鸿沟的数学方法,并以此为基础训练出一款适配文本的扩散模型,其性能媲美2019年OpenAI发布的GPT‑2,生成速度则快10倍。

基于该项成果,埃尔蒙创办Inception。眼下,他的雄心指向行业头部。Inception称其最新模型Mercury 2性能对标2023年OpenAI发布的部分GPT‑4版本,速度同样快10倍。

“我们非常看好这条路线,它具备规模化扩展的潜力。归根到底,速度与成本是衡量大模型价值的核心标准——你向它投入一块钱后能获得多少智能?”

——斯特凡诺·埃尔蒙

押注扩散技术的企业不只Inception一家。谷歌方面也正积极尝试,并已打造名为Diffusion Gemma的原型LLM。

路线04

干脆跳出文本世界

在围绕Transformer局限性探索创新方案的初创企业里,Pathway公司的理念最具颠覆性。他们想让大语言模型摆脱语言的束缚,并以此为目标开发了Dragon Hatchling大模型。

迄今为止,它最亮眼的成绩来自一项与超过25万多道超高难度数独题对战的基准测试。多家顶尖实验室的主流大模型难以破解哪怕一道谜题,Dragon Hatchling却攻克了97%以上的难关。

Pathway想传递的观点是:主流LLM虽在大量任务上表现出众,但仍对诸多关键类型的问题无能为力,数独只是其中一例。

公司联合创始人兼首席执行官祖赞娜·斯塔米罗夫斯卡(Zuzanna Stamirowska)表示,若要大模型针对现实问题产出真正原创的解决方案,就必须跳出Transformer框架。因为Transformer迫使大模型全部依靠文本完成推理,但语言并非某些推理形式的最优载体。

Pathway的解决方案是修改Transformer的底层数学逻辑,用“状态空间”(state space)这一数学结构替代注意力机制。

状态空间不再逐词编码信息,而是将信息压缩为更抽象的表达。以此为基础,Dragon Hatchling依旧能读写文本,同时也可模拟不依赖词语序列的推理模式。这不仅提升模型效率,理论上还可胜任其他LLM力不能及的任务。

“国际象棋和数学问题,并非以长句形式存在于人类脑中。大脑灵光一闪的顿悟,未必以语言形式出现。我们认为,若推理必须依托语言完成,这本身就是一种局限。主流LLM有能力阅读数独解题教程,再编写求解代码,但这并非我们所求,我们理想中的模型不局限于书本知识。

AI的星辰大海不是解数独题,而是攻克癌症——可这世上还没有一本现成的癌症解法手册。”

——祖赞娜·斯塔米罗夫斯卡

资料来源:


《世界科学》杂志版在售中 欢迎订阅

月刊定价

15元/期

全年订阅价

180元

点击左侧图片或以下方订阅方式选购

方式一

扫描二维码,“杂志铺”(第三方平台)订阅有折扣~

方式二

全国各地邮局订阅 邮发代号:4-263

方式三

机构订阅,请拨打

021-53300839;

021-53300838

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
当 AI、机器人正在进家,家准备好了吗?

当 AI、机器人正在进家,家准备好了吗?

晚点LatePost
2026-09-08 22:31:16
瞄定智能创新+全球化 奥克斯交出产业转型样本

瞄定智能创新+全球化 奥克斯交出产业转型样本

中国家电网
2026-09-11 09:54:17
农心杯三国擂台赛杨鼎新获三连胜特别奖,白山水杯俞斌时隔20年再战结城聪

农心杯三国擂台赛杨鼎新获三连胜特别奖,白山水杯俞斌时隔20年再战结城聪

野狐围棋
2026-09-11 19:48:59
兰州财经大学火了!新生父亲心疼斑驳水泥宿舍,和另一位家长亲手铺地板革改造宿舍,网友:水泥地面除了美观度差点,其他找不出缺点了吧

兰州财经大学火了!新生父亲心疼斑驳水泥宿舍,和另一位家长亲手铺地板革改造宿舍,网友:水泥地面除了美观度差点,其他找不出缺点了吧

火山詩话
2026-09-10 07:04:55
如果解放军单挑整个北约,胜算有多大?北约32国总兵力超340万

如果解放军单挑整个北约,胜算有多大?北约32国总兵力超340万

果妈聊娱乐
2026-09-11 15:30:20
普京时代或将落幕,中方有必要警惕俄罗斯转向!

普京时代或将落幕,中方有必要警惕俄罗斯转向!

律法刑道
2026-09-11 10:06:21
“鬼王”雷宇扬因胃癌去世终年62岁,小21岁妻子证实,曾主演《阴阳路》

“鬼王”雷宇扬因胃癌去世终年62岁,小21岁妻子证实,曾主演《阴阳路》

开开森森
2026-09-11 16:11:26
湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

大风新闻
2026-09-11 19:13:04
日本一家四口挤在8叠小船上生活!海水煮饭、洗尿布,夏天船舱热到超30度!

日本一家四口挤在8叠小船上生活!海水煮饭、洗尿布,夏天船舱热到超30度!

东京新青年
2026-09-10 19:10:51
这场臭气熏天的裸奔,辟谣后续来了!

这场臭气熏天的裸奔,辟谣后续来了!

胖胖说他不胖
2026-09-11 10:25:19
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
“9.11”事件25周年 纽约夜空2977架无人机重现世贸双子塔

“9.11”事件25周年 纽约夜空2977架无人机重现世贸双子塔

快科技
2026-09-11 09:01:06
果然被我说对了,美国白宫突然宣布了,从9月29日起直接禁止进口加拿大的酒精饮料、乳制品、部分摩托车等多个门类商品

果然被我说对了,美国白宫突然宣布了,从9月29日起直接禁止进口加拿大的酒精饮料、乳制品、部分摩托车等多个门类商品

扶苏聊历史
2026-09-11 16:43:19
64岁何超琼深圳剪彩,个子不高气场却两米八,背挺得笔直!

64岁何超琼深圳剪彩,个子不高气场却两米八,背挺得笔直!

眼底星碎
2026-09-11 18:19:39
一代鬼王,香港演员雷宇扬离世,终年62岁

一代鬼王,香港演员雷宇扬离世,终年62岁

电影票房预告片
2026-09-11 15:48:22
前TVB女星钟丽淇被曝进ICU,本人最新发文:恳请大家,不要对我的健康或病情做任何揣测,我需要专注自身的健康及好好陪伴家人

前TVB女星钟丽淇被曝进ICU,本人最新发文:恳请大家,不要对我的健康或病情做任何揣测,我需要专注自身的健康及好好陪伴家人

极目新闻
2026-09-11 19:43:36
省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

社会日日鲜
2026-09-11 09:11:11
在外滩大会上,我看到健康AI+硬件的新可能

在外滩大会上,我看到健康AI+硬件的新可能

爱范儿
2026-09-11 18:07:12
不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

宗介说体育
2026-09-11 10:29:21
生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

全景体育V
2026-09-11 11:12:32
2026-09-11 20:52:51
世界科学 incentive-icons
世界科学
《世界科学》编辑部运营账号
1951文章数 26958关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
游戏
健康
手机
公开课

艺术要闻

美国秘藏的一部《金刚经》!这才是楷书“金字塔尖”,欧颜柳赵也比不过

《金刚狼》晒新图!琴葛蕾眼睛冒光 IGN6分即将发售

手脚发麻口齿不清?也可能是中风!

手机要闻

苹果公布iPhone 18 Pro系列手机维修预估费用:电池服务1048元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版