抛弃Transformer,神经算子凭什么实现5万亿级物理上下文推演?
当行业还在疯狂内卷Transformer大模型的上下文窗口,从百万向千万级别冲刺时,英伟达前AI总监Anima Anandkumar带领的Accelerated Understanding团队,走出一条完全不同的技术路线:放弃Transformer,使用神经算子(Neural Operators)架构,推理阶段实现超过5万亿时空数据点的处理能力,直接对四维时空(三维空间+时间)的物理场进行完整推演。这并不是又一个更大的语言大模型,而是面向物理世界的新型科学智能。Transformer与神经算子,二者底层逻辑、适用边界、能力天花板有着本质区别。
![]()
架构对比概念图,左侧Transformer面向离散token序列;右侧神经算子面向连续四维物理场
大语言模型依靠Transformer自注意力机制横扫自然语言、图像、视频等领域,已经成为通用AI的事实标准。但这套建立在离散token序列之上的架构,面对真实物理世界时,暴露出先天短板:物理世界是连续场,流体、温度场、电磁、材料应力分布,不是一个个分割好的文字token或者像素碎片。把连续物理信息强行切割成离散序列,会带来信息损失、长时序误差累积、跨分辨率泛化差等一系列难题。
正是看到Transformer在科学计算场景的固有局限,Anima团队选择神经算子作为底座,目标不是预测下一个token,而是直接学习函数空间到函数空间的映射,一次性输出整个物理系统完整时空演化轨迹,而非逐帧迭代生成结果。
01底层逻辑:Transformer处理离散序列,神经算子学习物理算子
Transformer的核心是自注意力,把全部输入切分为离散token,计算token与token之间的关联。它擅长处理文本、对话、图片这类被人为离散化之后的数据。即便用Transformer做物理仿真,也需要把连续物理场打散成网格点token,序列长度爆炸,计算开销随序列长度平方增长,长时序推演极易出现误差漂移。
简单来说,Transformer是“点到点”的拟合,训练时记住网格上样本的对应关系,换一套分辨率网格,模型往往需要重新调优。
而神经算子的核心思想截然不同:不去拟合一组一组离散样本,而是直接学习支配物理系统背后的算子本身,也就是偏微分方程描述的物理规律映射关系。输入是初始物理场,输出就是完整演化后的物理场解。它具备网格无关性,训练完成之后,不需要重新训练,就可以适配不同分辨率、不同网格的物理仿真任务,这也是科学计算最看重的能力。
举个通俗例子:模拟流体湍流。
- Transformer方案:把空间切成大量网格token,一步一步向后推演时间,每一步都引入新误差,推演时间越长,偏差不断累积;
- 神经算子方案:输入初始流场,模型直接学习流体演化的算子,一次性输出一段时间全部空间‑时间演化结果,天然适配连续四维物理场。
Accelerated Understanding披露的数据极具冲击力:训练阶段上下文规模达到1万亿时空点,推理阶段突破5万亿时空点,这个量级和LLM的token上下文不能直接等价,但直观展现出神经算子处理连续大规模物理场的巨大潜力。
![]()
原理对比示意图,离散token序列vs连续函数映射
02五大维度对比:神经算子 vs Transformer在科学智能场景
1.处理对象
Transformer:面向离散token序列(文字、像素、网格点),需要对连续物理世界做强制离散切分。
神经算子:面向连续函数空间,原生适配物理场,不需要强行把时空切割成碎片。
2.长时序推演模式
Transformer:自回归逐步生成,一步一推演,误差会不断叠加,长时间推演容易失真。
神经算子:一次性输出完整时间维度演化轨迹,整体求解,规避分步迭代带来的累积误差。
3.泛化能力
Transformer:强依赖训练所用网格、采样方式,换分辨率性能容易大幅下滑。
神经算子:算子级泛化,一次训练,可适配同一类物理方程不同初值、不同分辨率场景。
4.计算代价随规模变化
Transformer:自注意力复杂度高,序列越长算力开销爆炸。
神经算子(FNO等):在频域完成全局运算,面向大规模物理场具备更好的扩展性。
5.擅长场景
Transformer:自然语言理解、对话、图像生成、通用多模态;也可做物理仿真,但属于“改造后适配”。
神经算子:流体力学、气象、核聚变等离子体、材料仿真、数字孪生等科学计算场景。
当然,这不代表神经算子会彻底淘汰Transformer。在语言交互、逻辑推理、通用知识问答上,Transformer依旧不可替代;神经算子强在物理仿真,并不擅长自然语言对话。二者不是完全替代,而是各有疆域。
![]()
03神经算子不是万能:它同样存在现实短板
不少报道将神经算子渲染为“可以推演整个宇宙的终极AI”,但我们依然需要理性看待它的边界。
第一,复杂多物理耦合场景训练门槛极高。想要学习真实世界复杂耦合物理算子,需要海量高质量物理仿真数据集,数据获取成本巨大。5万亿上下文是推理阶段的处理上限,不等于模型已经完美掌握全部复杂物理规律,相关公开基准测试结果仍有待进一步披露验证。
第二,复杂非线性强间断场景依旧存在局限。面对冲击波、相变这类强非线性突变物理现象,无论是FNO还是DeepONet,都依然会出现平滑过度、细节丢失问题,需要搭配物理约束、改进算子结构进行补偿 。
第三,缺少通用语言能力。神经算子专注物理场函数映射,本身不具备大模型的语言理解、常识推理能力。未来实用的科学智能,大概率是“神经算子做物理仿真 + Transformer做大模型交互”的混合架构。
04对AI发展的启示:通用AI不一定只有Transformer一条路
很长一段时间,行业形成一种思维惯性:做大模型就等于堆Transformer。但Anima Anandkumar团队的实践给行业提供另一种启示:任务决定架构,而不是用一套架构去硬啃所有任务。
Transformer在符号、语言类任务上所向披靡,但面对物理世界,连续函数空间才是事物本来的表达形式。神经算子走出一条“面向物理规律原生设计”的路线,为AI4Science、数字孪生、复杂工程仿真打开全新想象空间。
放到人机环境系统智能视角来看,Transformer更擅长处理“识”层面离散符号事实识别;而神经算子可以直接对连续环境场进行建模,对物理环境的刻画能力大幅提升。未来高阶智能系统,既需要语言大模型的符号理解,也需要神经算子对真实物理环境的深度建模,二者互相补充,才能够更好打通虚拟模型与真实物理世界。
![]()
结语与展望
5万亿级物理上下文的背后,不是简单又一次参数内卷,而是架构范式的转向:从“把世界切碎成token去预测下一个片段”,走向“直接学习支配世界运行的底层算子”。
Transformer不会就此落幕,它依旧是语言、通用认知领域的基石;但神经算子告诉我们:通往物理世界的AI,或许本就不该用语言模型的思路去构建。未来的科学智能,不是某一种架构通吃一切,而是不同架构各司其职,共同搭建连接数字计算与真实客观世界的桥梁。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.