进入下半年,AI行业像被按下了快进键。
6月智谱GLM-5.2,7月DeepSeekV4-Flash与字节Seedance2.5接连亮相;进入8月,阿里Qwen3.8-Max、谷歌Gemini3.7Flash、DeepSeekV4Pro正式版、智谱GLM-5.3又密集登场。与此同时,DeepSeek官宣成立专项团队攻坚AI Agent赛道,对标Anthropic Claude。
从模型能力到Agent应用,AI的进化速度已远超基础设施的迭代周期。
另一边,云厂商在AI基础设施的投入也与日俱增。国际高科技产业研究机构集邦咨询的最新数据显示,2026年全球九大云厂商合计资本开支规模将突破8867亿美元,同比增幅接近90%,这些资金均投向AI相关基础设施建设。此外,英伟达联合华尔街巨头,承诺投入5000亿美元建设AI基础设施。
国内方面,腾讯 8 月12日晚间公布的财报数据显示,2026年二季度资本开支升至528亿元,远超预期的321亿元,是上年同期191亿元的近三倍,其中绝大部分增量流向数据中心、GPU服务器与智算集群。东海证券最新研究报告透露,字节跳动、腾讯、阿里、百度四家合计资本开支年增速超过80%。
这种军备竞赛式的投入,直接推高了AI算力的密度与复杂度。中电标协数据存储专委会秘书长孙钢近期在采访中表示,AI时代存算关系正在发生根本性变化,存储正从被动的业务承载者转变为主动的效率引擎。
8月20日,阿里云飞天发布时刻一口气发布了三款面向AI场景的存储新产品——新一代全栈自研高性能并行文件存储CPFS、全球公共云首发G3.5层KVCache存储产品KVCacheStore以及业界首个为Agent场景设计的文件存储 AgenticFS。三款产品分别瞄准训练、推理与Agent落地,围绕AI Native和Agent Native两大方向,一套面向AI全生命周期的存储体系正浮出水面。
![]()
![]()
重建云存储:阿里云存储打出三套组合拳
那么,面向AI全生命周期的存储体系,究竟该如何构建?
阿里云给出的答案是:将存储架构与AI工作负载深度解耦,针对训练、推理、Agent三大核心场景,分别提供专用化的存储解决方案。
训练侧:CPFS,让 GPU 从等数据到火力全开
首先来看训练场景。模型训练面临三大挑战。
第一,模型迭代速度不断加快,高频率的Checkpoint对于存储吞吐产生更大压力。Checkpoint间隔从几十分钟缩短到数秒级,模型参数量从千亿迈向数万亿,单次写入量远超之前。
第二,数据集规模快速增长。训练数据扩展至百PiB,数据类型从以文本为主,走向多模态数据。特别是在自动驾驶场景,数据集动辄达到数百PB级,传统文件存储的架构扩展性问题成为瓶颈。Burst I/O与高水位读吞吐成为常态,要求存储系统具备稳定的有效吞吐与低延时。海量小文件与深层目录结构,则对元数据性能提出更高要求。
第三,冷热数据混合的模式,使得全部使用基于SSD的高性能存储规格,导致成本急剧上涨。企业需要持续优化存储成本。
面对这些挑战,阿里云推出了全栈自研的并行文件存储CPFS。从后端存储到DPU加速通道,再到EFC弹性客户端,全链路基于自研技术,针对训练场景的IO特征构建了端到端的加速能力。
![]()
CPFS基于阿里云盘古分布式存储底座,采用Scale-out分布式架构设计,元数据与数据分离独立扩展,实现容量和性能线性扩展。在计算节点侧通过DPU卸载存储协议栈,构建专用的高速存储访问通道,并通过数据零拷贝,来大幅提高计算节点访问存储的性能。
通过这些技术创新,CPFS单文件系统可提供高达百TB/s级别的吞吐和亿级IOPS,充分满足训练场景对存储的性能需求。在规模上,支持单文件系统线性扩展达百PiB容量、万亿级文件。在成本上,CPFS提供多档存储规格,智能的数据生命周期管理,大幅优化存储成本。
这些能力也已经在通义千问大模型训练中得到验证。模型启动平均耗时下降50%,峰值算力利用率提升30%,业务承载能力翻倍。语料供给从“等数据”变为“追算力”,高质量数据处理效率实现代际跃升。
推理侧:KVCacheStore,大模型推理的 KV Cache 加速引擎
接下来看推理场景。
大模型推理中,多轮对话与长上下文推理成为趋势,KV Cache数据量爆发式增长,显存和内存所构建的有限KV Cache容量,直接影响缓存命中率与服务吞吐能力。具体来看,有以下四大场景挑战。
第一,长上下文推理加速。上下文窗口长度迈向1M+,KV Cache数据也在持续膨胀,需要以存代算,将KV卸载至高性能、弹性扩展存储层,来突破显存内存墙,降低TTFT。
第二,多轮对话与会话迁移。会话跨节点迁移与故障切换时,KV状态丢失需整段重算。需要将KV状态持久化于共享存储,实现迁移与Failover免重算,对话不中断,算力调度更灵活。
第三,P/D分离架构下,KV需在两者间高频流转。需要通过共享存储来承接KVCache的中转,提供高带宽、亚毫秒级时延,消除数据搬运瓶颈。
第四,共享前缀复用。System Prompt等公共前缀,被大量请求重复Prefill。需要公共前缀一次写入、全局共享,多请求并发读同一份KV,提升命中率与GPU利用率。
因此,针对这些挑战,阿里云全新发布了KVCacheStore,作为大模型推理的KV Cache加速引擎。它定位为G3.5层KVCache存储,是全球公共云首发的G3.5层KVCache存储产品。
![]()
其技术优势体现在三点:
第一,支持高效的KV接口,并面向主流推理框架提供定制化Connector,实现推理引擎与存储之间数据零拷贝,最大程度简化存储与推理平台的对接,快速形成生产力。
第二,支持与算力的亲和性部署。从架构上KVCacheStore定位于G3.5层,可提供优于远端G4共享存储的性能,单计算节点可提供40GB/s的吞吐,通过batch接口达到百万QPS。
第三,KVCachestore独立于算力部署,支持弹性扩容,单实例就可以满足客户千亿级KV的存储规模。
在客户的POC验证中,KVCachestore将缓存命中率提升了20%以上,极大提升了推理服务的效率。
Agent侧:AgenticFS,给每个Agent一间“独立办公室”
最后来看Agent场景。
Agent时代的工作负载呈现出生命周期短、弹速极快、波峰波谷瞬时切换的特征,且数量级往往达到百万级别。传统文件系统的挂载速度、权限隔离和资源调度能力,难以支撑这种高并发、短生命周期的爆发式负载。与此同时,Agent的普及也带来了新的安全挑战:恶意Agent越权访问、个别Agent异常行为挤占其他Agent资源,这些在传统NAS架构下几乎无解。
阿里云的解法是AgenticFS:以AgenticSpace为单元,赋予每个Agent独立的命名空间、配额与性能隔离。
![]()
具体技术优势体现在三点:
- 百万级动态创建+ 10万QPS挂卸载,秒级完成百万AgenticSpace的创建挂载,传统分钟级操作被压缩到毫秒级;
- Access Point + 零信任鉴权,权限隔离粒度从“文件系统级”细化到“Agent实例级”,无需为每个Agent单独建文件系统;
- 容量与性能双隔离,个别异常Agent只消耗自己空间内的资源,不会影响其他Agent或平台稳定性。
在AgenticFS之外,阿里云还在存储产品的服务层做了两个Agent化的尝试。
- OSS Agent是基于通义大模型构建的智能体服务,支持用户通过自然语言完成Bucket管理、异常诊断、健康巡检、费用分析,以及对Bucket中视频、图片、文档等多模态数据的语义检索与直接对话。
- CDE Agent则是阿里云盘企业版打造的企业级AI数字工作室,在网盘内无缝实现文件处理与内容生成,支持多模态检索、自动总结与安全分享,全程数据不出域、权限原生继承、操作全程审计。
三者结合,构成了从底层基础设施到上层应用交互的完整Agent存储闭环。
![]()
存储成为决定AI生产力上限的关键变量
这样来看,阿里云此次发布的三款新品并非简单的功能叠加,而是基于阿里云存储十余年技术积淀与对AI场景深度理解的必然结果。
一方面,这是阿里云存储面向AI时代补齐的一块拼图。目前,阿里云存储产品矩阵已经覆盖了对象存储、通用文件存储、高性能并行文件存储、表格存储等场景,但面向AI推理的KV Cache专用存储、面向百万级Agent的弹性文件存储还是空白,KVCacheStore和AgenticFS的出现,加上重构后的CPFS,让阿里云存储形成了覆盖训练、推理、Agent的AI全生命周期的完整产品体系。
另一方面,这也是阿里云对云存储底层架构的一次技术重构。基于飞天盘古底座,存储不再是被动等待调用的仓库,而是主动参与到算力调度中:向下,打破内存与外存的物理边界,用极低时延的KV层为GPU显存减负;向上,重塑文件系统的挂载与隔离机制,让文件系统本身具备微服务般的弹性与敏捷度;在底层,则通过去中心化元数据与并行I/O栈,让数据流速真正追上GPU的计算速率。这就意味着存储和算力之间的关系正在被重新定义——即存储已经跳出了跟随业务做适配的被动局面,转而以AI原生的姿态,主动定义数据在模型全生命周期中的流转方式。
更进一步看,存储的角色正在从被动承载走向主动编排。过去,存储往往只是数据的仓库。如今,CPFS把高性能文件存储做成按需扩容、按秒计费的弹性服务;KVCacheStore用原生KV接口和算力亲和部署把KV Cache的外溢成本打下来;AgenticFS则为百万Agent提供了即取即用的独立办公室。当数据供给可以按需流动、按需卸载、按需隔离,业务逻辑也不必再为存储瓶颈妥协。
简言之,存储正从后台走向前台,成为决定AI生产力上限的关键变量。当存储的下限被不断抬高,真正的竞争才会回到业务创新本身。谁的场景抽象得更准,谁的模型迭代得更快,谁能让数据以最低的成本、最快的速度流经算力,谁就能在下一轮浪潮中胜出。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.