上周早些时候,Microchip和Micron发布了全新的PCIe Gen6 AI存储架构,这一进展指向了整个行业的更大趋势——它超越了任何单一硬件平台,标志着AI基础设施正进入一个存储性能比以往任何时候都更重要的阶段。
![]()
企业持续部署更大规模的训练集群,并不断扩展推理工作负载。这意味着一个关键挑战:如何足够快地交付数据,让日益强大的加速器保持满负荷运转。这正是存储技术被推到聚光灯下的原因。
"提升数据中心性能不是靠单一组件就能解决的,我们与Micron的合作凸显了采取协同方案的重要性,"Microchip数据中心解决方案业务部企业副总裁兼总经理Brian McCarson表示。据他介绍,合作目标是将两家公司在存储和交换领域的优势结合起来,打造能够处理更大工作负载、更高效移动数据的AI系统。
![]()
就在不久前,行业话题还几乎全是如何拿到足够的GPU。今非昔比。超大规模云厂商和企业IT团队正在更加密切地审视技术栈的其余部分——网络、内存和存储正全部成为决定系统整体性能的关键因素,因为哪怕是最强大的加速器,如果大部分时间都在等待数据,其价值也会大打折扣。
而这一挑战不会变得更轻松。拥有最快的芯片固然重要,但随着AI系统持续扩展,最终胜出的可能是那些能够最高效地在系统中传输数据的厂商。
![]()
压力并非来自某一种工作负载,而是所有负载同时施压。训练仍然需要移动海量数据,但推理的需求正迅速变得同样严苛。部分原因在于企业部署了越来越多的AI助手、编程工具和检索增强生成(RAG)应用——这些系统持续从向量索引和其他数据集中调取数据。这意味着存储正从后台走向前台,越来越多地出现在关键路径上。
这也是过去一年存储厂商在AI话题中存在感显著提升的原因之一。VAST Data、Pure Storage,以及现在的Microchip和Micron,都在试图解决同一个问题的不同方面。GPU或许在执行计算,但周边基础设施决定了企业实际能发挥多少计算性能。
![]()
这一时机并非巧合。过去两年,AI基础设施支出加速增长。每一代新硬件都会暴露出不同的瓶颈——先是GPU供应,然后是网络和电力。现在,随着企业部署更大规模的集群、努力让昂贵的AI系统保持高利用率,存储也加入了瓶颈清单。
这些不断变化的格局,为能够改善整个基础设施栈中数据移动效率的厂商带来了新的机遇。
存储厂商们也在传递相似的观点。他们不再只谈更快的SSD,而是越来越多地讨论能够跟上现代AI系统步伐的完整存储架构。
![]()
"AI基础设施正在进入一个新时代——存储性能和生态系统互操作性必须齐头并进,"Micron核心数据中心业务部解决方案营销高级总监Larry Hart表示。"Micron 9650 SSD(业界首款量产的PCIe Gen 6 SSD)与Microchip的Switchtec PCIe Gen 6交换技术相结合,展示了可扩展存储架构如何帮助数据中心在下一代AI、HPC和云工作负载中实现更高吞吐量、更低延迟和更高效的数据移动。"
对互操作性的强调值得关注。AI基础设施已经变得过于复杂,单一组件无法决定整体性能。更快的GPU有帮助,但更快的网络、内存子系统和存储同样重要。如果技术栈中有任何一环掉队,都可能限制其他所有部分的性能。这就是为什么基础设施厂商越来越多地谈论完整平台,而非单个产品。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.