![]()
谷歌在Cloud Next上发布了第八代张量处理单元——TPU,对应于市场上大量应用的英伟达的AI芯片GPU,标志着将AI能力拆分到两款专用芯片的战略转变。
其中TPU 8t以AI模型训练为目标,性能提升2.8倍;而TPU 8i则专注于推理,性能提升80%。两款芯片都放弃了x86架构,采用定制的Axion ARM CPU,标志着谷歌在AI Agent时代推动全栈效率的步伐。
1.谷歌TPU分为用于训练和推理的两大芯片
谷歌在美国拉斯维加斯举行的Cloud Next大会上宣布其AI硬件战略发生根本性转变,首次发布第八代张量处理单元TPU,将训练和推理工作负载分离。
公司推出了用于模型训练的TPU 8t和用于推理的TPU 8i,将这些定制的AI芯片定位为其所谓“智能人工智能时代”的专用解决方案。
这种双向策略与亚马逊云服务的策略相呼应,后者早期认识到专用的人工智能硬件可以消除针对每个工作负载的特定瓶颈。
谷歌声称TPU 8t的AI模型训练速度比去年的Ironwood TPU快了2.8倍,而TPU 8i在大型语言模型推理方面每美元性能提升了80%。
亚马逊云科技(AWS)推出了两类专用芯片:Trainium(训练芯片),专为高效、低成本训练大模型而生,最新一代产品是2025年12月发布Trainium 3,•相比通用GPU,可降低训练成本高达50%
Inferentia(推理芯片),为快速、低成本部署AI服务而设计。已推出两代Inferentia1 和 Inferentia2,成本比通用GPU低得多,适合大规模推理场景(如客服机器人、推荐系统)。
通过Trainium + Inferentia 的组合,AWS为客户提供了一套端到端、高性价比的AI芯片解决方案,既能高效训练模型,又能低成本部署应用,助力企业加速AI落地。
![]()
2.TPU 8t大规模定义了大模型的训练能力
用于模型训练的TPU 8t代表了谷歌将前沿模型开发从数月缩短到数周的承诺,且
大规模定义了TPU 8t训练能力。
更新后的服务器集群称为pods,现包含9600颗芯片,配备2PB共享高带宽内存,每个Pod提供121个FP4 EFlops的计算量——几乎是Ironwood训练计算上限的3倍。
每个AI加速器配备216 GB高带宽内存,带宽6.5 TB/s,128 MB片上SRAM,以及最高12.6 petaFLOPS的4位浮点计算能力。
谷歌声称TPU 8t可线性扩展,支持单一逻辑集群中多达100万芯片,利用光电路交换机连接多达9600个AI加速器,形成统一的平台。
多个Pod通过新的Virgo网络以扁平的两层拓扑方式连接,支持每个数据中心最多134,000个TPU。
![]()
谷歌强调TPU 8t的良好计算率为97%,这意味着芯片花更多时间主动推进AI模型训练,而不是等待或处理故障。
在前沿训练规模下,每100分点都可能转化为活跃训练天数。第八代芯片每瓦性能是Ironwood的两倍,TPU 8t每瓦性能提升124%,TPU 8i提升117%。
Google Cloud 还开发了一套托管 Lustre 存储系统,能够将 10 TB/s 的汇总数据直接传输到加速器内存中。
与TPU联合设计的数据中心采用单芯片集成网络和更高效的舱体布局,据称每单位电力计算能力提升了6倍。
3.TPU 8i 优化了代理工作负载的推理
TPU 8i用于推理,解决了用户提交提示后模型的持续使用,这一工作量与训练有根本不同。谷歌将片上SRAM扩展到每颗芯片的384 MB,与英伟达即将推出的Groq 3 LPU硬件相匹配。
更大的缓存使TPU 8i能够在片上保留更多键值信息,从而加快拥有更长上下文窗口的模型。推理单元现在包含1152个芯片,而Ironwood推理集群仅有256个,每个单元可实现11.6个EFlops。
该架构旨在“提供大量吞吐量和低延迟,以经济高效地同时运行数百万代理”。Lohmeyer指出,“交易数量大幅增加,而每次交易的成本必须大幅降低,才能实现规模化。”
谷歌TPU 在全栈ARM方法中取代了x86。第八代AI加速器是谷歌首次完全依赖其定制的Axion ARM CPU主机,其配置为每两个TPU配备一个CPU,而Ironwood则是一颗x86 CPU服务4个TPU芯片。
这种基于ARM的“全栈”方法提高了效率,类似于亚马逊今年早些时候整合Graviton和Trainium 3的做法。
谷歌还将其第四代液冷系统适配于新芯片,利用主动控制阀门根据工作负载调整水流。这两个新的TPU都支持开发者已经使用的框架,包括JAX、MaxText、PyTorch、SGLang和vLLM。
4.谷歌TPU并未完全取代英伟达
谷歌并未完全取代英伟达GPU,而是继续提供基于英伟达芯片的服务,并承诺将在今年晚些时候部署英伟达即将推出的Vera Rubin芯片。
公司宣布与英伟达合作,开发计算机网络技术,使基于Nvidia的系统在其云基础设施中表现更高效,特别是增强名为Falcon的软件网络技术。
不过谷歌宣布后,英伟达股价短暂下跌约1.5%。
DA Davidson分析师在9月估计,谷歌TPU业务加上Google DeepMind,价值约为9000亿美元。采用率正在加快,Citadel Securities正在TPU上构建定量研究软件,美国能源部所有17个国家实验室都使用基于芯片构建的AI共同科学家软件,Anthropic则承诺使用价值数吉瓦的Google TPUs。
谷歌这两款TPU芯片将为谷歌基于Gemini的代理提供动力,并于今年晚些时候正式上市。
![]()
来源:本津加
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.