网易首页 > 网易号 > 正文 申请入驻

AI芯片竞争为什么正在从“算力竞赛”变成“系统效率竞赛”?

0
分享至

峰值FLOPS越来越难解释真实竞争力

写给AI芯片公司CEO、CTO、架构师和产业投资人的一篇系统分析

开篇:AI芯片行业正在进入一个危险的误判周期

过去十年,半导体行业形成了一套非常成熟的性能评价体系:

晶体管数量更多;

制程节点更先进;

频率更高;

TOPS/FLOPS更大。

在CPU时代,这套逻辑长期有效。

因为CPU执行的大部分任务,本质上受单核性能、缓存效率和指令吞吐影响。

但AI计算正在改变这个游戏规则。

今天,一颗AI芯片标称:

  • 1000 TFLOPS FP16;

  • 2000 TOPS INT8;

  • 10 PFLOPS FP4;

并不能回答最重要的问题:

它到底能让一个真实模型更快训练多少?能让多少用户同时推理?每个token成本是多少?每瓦产生多少有效智能?

这也是为什么AI芯片竞争正在从:

谁的峰值算力最高

转向:

谁能把计算、内存、通信、软件和数据中心组合成最高效率的AI系统。

峰值FLOPS正在成为类似汽车发动机排量的指标。

它仍然重要。

但它越来越不能代表整车性能。

一、问题是什么:为什么峰值FLOPS正在失去解释力? 原始问题:

AI模型的计算需求增长速度超过单芯片能力增长。

于是产业采用两个方向:

第一,提高单芯片算力。

第二,把更多芯片连接起来。

这产生了一个表面矛盾:

芯片越来越强。

但系统效率提升越来越困难。

原因是什么?

因为AI计算已经从:

计算问题

变成:

数据移动问题。

传统计算:

Memory → CPU → Result

路径相对简单。

现代大模型:

HBM
↓
Tensor Core
↓
Cache
↓
NVLink/ICI
↓
Other Accelerator
↓
Network
↓
Other Node
↓
Storage

计算单元只是其中一个环节。

任何一个环节不足,峰值计算都会浪费。

Google Cloud在介绍AI加速器性能分析时,也明确指出AI加速器性能主要受三个因素约束:

  1. 计算能力;

  2. HBM等内存带宽;

  3. 芯片间网络带宽。

也就是典型Roofline模型:

FLOPS只是性能上限,不是实际性能。 ([Google Cloud Documentation][1])


二、第一个误区:峰值性能 ≠ 有效性能 1. 为什么芯片厂商喜欢宣传峰值?

因为峰值容易比较。

例如:

A芯片:

20 PFLOPS FP8

B芯片:

15 PFLOPS FP8

看起来A一定更强。

但真实AI workload中,需要回答:

  • Matrix Multiply占多少?

  • Memory Access占多少?

  • Communication占多少?

  • Kernel是否融合?

  • Batch size是多少?

  • 模型是否稀疏?

  • Precision是否可用?

一个简单例子:

假设:

芯片A:

100单位计算能力

10单位内存带宽

芯片B:

70单位计算能力

20单位内存带宽

如果任务是:

大型矩阵乘法:

A可能领先。

如果任务是:

LLM Decode:

B可能反超。

因为Decode通常受:

  • KV Cache;

  • HBM bandwidth;

  • memory latency

限制。

所以今天AI芯片真正应该比较的是:

Effective Performance


=
Peak Compute
×
Memory Utilization
×
Communication Efficiency
×
Software Utilization

而不是:

Peak FLOPS

三、第二个误区:单卡性能 ≠ 集群性能

AI时代最大的变化:

计算单位从芯片变成集群。

过去:

一颗CPU性能决定服务器。

今天:

10000颗AI accelerator如何协同决定竞争力。

为什么?

因为大模型训练已经进入:

  • Tensor Parallel;

  • Pipeline Parallel;

  • Data Parallel;

  • Expert Parallel。

尤其MoE模型。

MLPerf Training v6.0已经加入DeepSeek V3等MoE训练基准,并出现更多硬件和系统参与,反映训练竞争正在从单纯密集计算转向复杂系统效率竞争。([MLCommons][2])

假设:

芯片A:

单卡性能高20%。

但是:

  • 通信效率低;

  • Collective效率差;

  • 软件优化不足。

芯片B:

单卡弱。

但是:

  • scale-up效率高;

  • 集群利用率高。

最终:

B可能完成训练时间更短。

成立条件

这个判断成立,需要:

  • 模型规模足够大;

  • 通信比例足够高;

  • 集群规模足够大。

代价

系统优化越来越复杂:

需要:

  • 网络工程;

  • 编译器团队;

  • Runtime团队;

  • 分布式训练专家。

证伪信号

如果未来模型越来越小:

例如:

边缘模型;

端侧模型;

单机Agent。

那么单芯片效率重新重要。

四、芯片架构:从通用计算走向领域专用 原始约束:

AI工作负载高度变化。

今天:

Transformer。

明天:

MoE。

后天:

Agent。

所以芯片必须面对:

灵活性 vs 效率

的矛盾。

GPU为什么成功?

不是因为GPU每个指标最好。

而是:

它提供:

  • 大规模并行;

  • 可编程性;

  • 成熟软件生态。

ASIC为什么出现?

因为大量AI计算已经稳定。

例如:

推荐系统;

广告排序;

固定推理服务。

这些任务:

模型固定;

数据固定;

优化空间明确。

补偿方式:

ASIC删除通用性。

换取:

  • 更高能效;

  • 更低成本;

  • 更高吞吐。

代价:

失去:

  • 软件适应性;

  • 模型迁移能力;

  • 生命周期弹性。

最大风险:

AI变化速度超过芯片生命周期。

一颗ASIC设计周期:

2-4年。

模型变化:

可能半年。

因此:

未来不是GPU消失。

而是:

GPU内部越来越ASIC化。

ASIC越来越系统化。

两者融合。

五、HBM:AI竞争正在进入内存时代 原始约束:

计算增长速度超过数据供给速度。

Tensor Core越来越快。

但数据进不来。

于是瓶颈从:

Compute Wall

变成:

Memory Wall。

HBM解决什么?

不是提高计算。

而是:

提高数据搬运能力。

现代AI芯片竞争:

已经不是:

“多少核心?”

而是:

“多少数据可以快速进入核心?”

NVIDIA Blackwell平台就是典型例子。

其GB200 NVL72系统设计重点不仅包括Tensor Core,也包括:

  • HBM;

  • NVLink;

  • 大规模系统互联。

官方规格显示,GB200 NVL72通过NVLink连接72个GPU,并强调大规模训练和推理系统能力。([NVD Orangelogic][3])

但HBM不是免费午餐。

代价:

第一:

成本。

HBM供应受到:

  • TSV;

  • 堆叠良率;

  • 先进封装。

限制。

第二:

功耗。

高速Memory Interface消耗巨大能源。

第三:

供应链。

HBM已经成为AI芯片供应链关键瓶颈。

瓶颈迁移:

解决Compute问题。

转移到:

Memory Capacity问题。

解决Bandwidth问题。

转移到:

封装问题。

六、先进封装:摩尔定律后的新战场 原始约束:

传统Scaling越来越困难。

先进制程:

成本增加;

良率下降;

设计复杂。

产业开始转向:

Chiplet。

Chiplet优势:

把系统拆开:

Compute Die

Memory

IO

Networking

分别优化。

但Chiplet不是免费提升。

它增加:

  • 封装复杂度;

  • Die-to-Die通信;

  • 热设计难度;

  • 测试复杂度。

最大的挑战:

不是做出来。

而是:

大量可靠生产。

技术可行:

存在。

产品可用:

需要:

  • 良率;

  • 测试;

  • 成本。

大规模部署:

需要:

供应链成熟。

七、互联:AI系统正在从“芯片竞争”变成“网络竞争”

未来最大的竞争单位:

不是GPU。

是AI Factory。

因为:

10000颗芯片如果不能有效通信,

等于10000个孤岛。

互联分两个层:

Scale-up

芯片内部高速连接。

目标:

让多个芯片像一个巨大芯片。

Scale-out

数据中心网络。

目标:

让多个节点协同。

NVIDIA持续强化NVLink和网络产品,本质上就是把竞争从GPU延伸到整个AI基础设施。GB200 NVL72等系统已经把高速GPU互联作为核心设计元素。([NVD Orangelogic][3])

开放互联的挑战

很多人认为:

开放标准出现。

NVIDIA优势消失。

这是过度简化。

协议只是开始。

真正需要:

  • PHY;

  • Switch;

  • 软件栈;

  • Collective Library;

  • 调试工具。

互联生态成熟需要时间。

八、软件栈:未来最大的隐藏护城河

很多芯片公司低估一个事实:

AI芯片不是硬件产品。

它是软件产品。

完整链路:

Framework

↓

Compiler

↓

Runtime

↓

Kernel

↓

Hardware

如果硬件性能100。

软件利用率50%。

实际只有50。

优秀硬件:

需要:

  • 自动调优;

  • Kernel优化;

  • Graph compiler;

  • Memory scheduling。

CUDA今天的重要性:

不是API。

而是:

20年的软件资产。

未来挑战:

如果Compiler越来越成熟:

硬件差异会被隐藏。

但这个过程很慢。

因为:

软件生态具有路径依赖。

九、Runtime和Kernel:决定最后30%的性能

很多芯片在实验室性能很好。

进入真实模型:

性能下降。

原因:

不是芯片。

而是:

Kernel。

AI模型越来越复杂:

  • Flash Attention;

  • MoE routing;

  • Quantization;

  • Fusion;

  • Dynamic batching。

芯片架构必须围绕软件共同设计。

未来优秀AI芯片团队:

不会只有:

RTL工程师。

必须同时拥有:

  • Compiler专家;

  • Framework专家;

  • Model专家。

十、数据中心功耗:下一堵墙

AI计算最大的限制:

可能不是晶体管。

而是电力。

假设:

芯片性能提升。

但是:

机架功耗翻倍。

那么:

数据中心规模无法扩张。

未来竞争指标:

不是:

PFLOPS。

而是:

tokens / kWh

tokens / dollar

tokens / rack

十一、系统TCO:最终商业胜负手

芯片公司容易犯一个错误:

证明:

“我的芯片更快。”

客户真正关心:

“我的AI服务成本是否下降?”

TCO包括:

硬件

芯片;

HBM;

服务器。

软件

迁移;

维护。

数据中心

电力;

冷却;

空间。

运营

可靠性;

调度;

故障恢复。

一颗芯片:

性能领先20%。

如果:

软件迁移成本巨大。

可能没有商业价值。

十二、AI芯片公司的产品定义应该如何改变?

未来芯片定义不能从:

“多少TOPS”

开始。

应该从:

第一层:

目标模型。

训练?

推理?

Agent?

第二层:

目标指标。

不是:

FLOPS。

而是:

  • tokens/s;

  • tokens/W;

  • tokens/$;

  • time-to-train。

第三层:

系统边界。

卖:

芯片?

还是:

服务器?

还是:

完整AI Factory?

第四层:

软件战略。

有没有:

Compiler?

Runtime?

Developer ecosystem?

十三、未来竞争格局:三个判断判断一: 算力仍重要,但只是进入系统竞争的门票。

成立条件:

模型规模继续增长。

证伪:

模型效率大幅提升。

判断二: HBM和互联重要性会超过单纯计算核心数量。

成立条件:

大模型继续受memory和communication限制。

证伪:

算法革命显著降低数据移动。

判断三: AI芯片公司最终竞争的是系统能力。

成立条件:

客户越来越购买集群。

证伪:

大量AI回到端侧、小模型。

十四、给产业投资人的三个提醒 第一:

不要只看TOPS。

看:

有效利用率。

第二:

不要只看芯片。

看:

软件团队。

第三:

不要只看Demo。

看:

规模部署。

很多技术:

可以Demo。

但不能量产。

很多芯片:

可以量产。

但不能形成生态。

很多生态:

可以形成。

但无法盈利。

结论:

AI芯片竞争的核心已经发生变化。

过去:

制程决定芯片。

今天:

架构决定芯片。

未来:

系统决定芯片。

峰值FLOPS不会消失。

它仍然代表潜在能力。

但未来赢家不会是:

拥有最高峰值算力的公司。

而是:

能够把:

计算、

内存、

互联、

封装、

软件、

能源、

供应链、

工程组织

组合成最高系统效率的公司。

AI时代真正的芯片竞争,不是制造更强的计算单元。

而是制造更高效率的智能基础设施。

从“芯片设计竞争”,走向“AI系统工程竞争”,这才是下一阶段半导体产业最大的变化。

[1]: https://docs.cloud.google.com/docs/ai-ml/accelerator-performance-benchmarking?utm_source=chatgpt.com "AI accelerator performance and benchmarking | Generative AI | Google Cloud Documentation"
[2]: https://mlcommons.org/2026/06/mlperf-training-v6-0-results/?utm_source=chatgpt.com "MLPerf Training v6.0 Results: New MoE Benchmarks and Record System Diversity | MLCommons"
[3]: https://dam-cdn.nvd.orangelogic.com/AssetLink/y441155802qub41q118b2852i557jem5.pdf?utm_source=chatgpt.com "Datasheet for NVIDIA Blackwell Architecture | NVIDIA"

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
量化基金裁员了很多清北高材生

量化基金裁员了很多清北高材生

微微热评
2026-10-04 12:39:40
杜汶泽妻子病痛升级!曝肺腺癌转淋巴了,目前已停止接受靶向治疗

杜汶泽妻子病痛升级!曝肺腺癌转淋巴了,目前已停止接受靶向治疗

小徐讲八卦
2026-10-04 10:20:25
梅婷宠着、闫妮护着,长得不帅却总演央视大剧,石云鹏到底凭什么

梅婷宠着、闫妮护着,长得不帅却总演央视大剧,石云鹏到底凭什么

精彩背后的故事
2026-10-05 18:58:04
他达拉非一片管36小时,是“神药”还是科学?科学解释来了

他达拉非一片管36小时,是“神药”还是科学?科学解释来了

奇妙的本草
2026-08-12 12:20:07
最可惜的政坛陨落:曾经的深蓝猛将,如今为何人心尽失?

最可惜的政坛陨落:曾经的深蓝猛将,如今为何人心尽失?

鲁源写作读书会
2026-08-24 07:00:34
CBA猛料!媒体人嘲讽篮协,上海大将伤病恢复良好,广东男篮伤大将

CBA猛料!媒体人嘲讽篮协,上海大将伤病恢复良好,广东男篮伤大将

中国篮坛快讯
2026-10-05 14:32:13
男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

背包旅行
2026-09-15 11:30:07
难怪中国舍不得对菲律宾下死手,马尼拉公布的一份报告令人惊叹!

难怪中国舍不得对菲律宾下死手,马尼拉公布的一份报告令人惊叹!

小马姨
2026-10-05 10:34:48
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

药师方健
2026-10-02 22:19:37
5岁男孩腋下包块一个月疯长,疼到手臂不敢放下!多家医院无解,直到妈妈随口说了一句话

5岁男孩腋下包块一个月疯长,疼到手臂不敢放下!多家医院无解,直到妈妈随口说了一句话

新民晚报
2026-09-28 09:47:28
李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

爱竞彩的小周
2026-10-02 04:39:54
排列五预测今日推荐号精选,排列五预测最准确走势

排列五预测今日推荐号精选,排列五预测最准确走势

炫葛立潮端
2026-10-05 23:07:29
莫言:永远不要期望一个没有血缘关系的人,能真正站在你的角度替你考虑问题——这是成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能真正站在你的角度替你考虑问题——这是成年人最大的清醒

杏花烟雨江南的碧园
2026-09-30 16:15:04
如果人民公社活到今天,农村早就不用振兴了?

如果人民公社活到今天,农村早就不用振兴了?

游文刀
2026-09-25 12:53:10
菲律宾最高法院驳回全部质疑请愿,扫清杜特尔特弹劾案法律障碍

菲律宾最高法院驳回全部质疑请愿,扫清杜特尔特弹劾案法律障碍

书写传奇
2026-10-05 14:28:46
向华强大嫂离世设灵,花圈纸扎品摆满殡仪馆外,现场大批警察驻守

向华强大嫂离世设灵,花圈纸扎品摆满殡仪馆外,现场大批警察驻守

树娃
2026-10-05 13:18:21
年纪大了要远离核桃?医生直言:不想常进医院,3种坚果最好少吃

年纪大了要远离核桃?医生直言:不想常进医院,3种坚果最好少吃

坠入二次元的海洋
2026-10-03 20:27:44
3分钟对轰世界波!十人葡萄牙2-1逆转世界杯大黑马 欧国联无敌4连胜

3分钟对轰世界波!十人葡萄牙2-1逆转世界杯大黑马 欧国联无敌4连胜

狍子歪解体坛
2026-10-05 04:43:42
2026-10-05 23:39:00
老虎说芯 incentive-icons
老虎说芯
资深半导体工程师的经验分享
901文章数 31关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
亲子
数码
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

数码要闻

玩家“魔改”12V-2×6:引入额外2组8Pin分流供电,减负效果显著

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄军连续4天轰炸基辅大桥

无障碍浏览 进入关怀版