网易首页 > 网易号 > 正文 申请入驻

存储呼呼涨,中科曙光对KV Cache下手了

0
分享至

这一两年,大家都被内存、SSD、存储设备的涨价搞破防了吧?

跟AI大模型沾点边的“存储器”,都在猛涨!



注:根据知名机构TrendForce预计,2026年第三季度,DRAM合约价格将环比上涨13%—18%,NAND Flash合约价格上涨10%—15%。

这种“涨不停”形成了让人无语的尴尬循环↓

大模型把存储需求推高了,存储涨价又反过来抬高了大模型的推理成本。



而偏偏这时候,推理需求彻底大爆发!

上下文越来越长,对话轮数越来越多,大模型越来越“聊不起”了,又慢又贵。



为什么大模型这么“吃存储”?

一切的背后,都绕不开大模型推理的一项细节技术:KV Cache

KV Cache是个大冤种

KV Cache相当于大模型的“工作记忆”。

大模型的脑回路有点特别,在回答问题的时候,每吐一个新字(token),都要把前面上下文重新参考一遍。



就好比一个傻小子爬楼,每向上爬一层,都要返回一楼重新蓄力,把爬过的楼层重爬一遍…

你说折腾不折腾。



为了解决大模型这种死脑筋,KV Cache机制就出现了。

它把前面已经计算过的Key和Value保存在缓存中,下次生成新Token时,模型只需要计算新增内容,历史结果直接从KV Cache里拿。



有了这份记忆,大模型虽然还是那个脑回路,但不需要对前面的内容进行重复计算了。



然而,这份记忆是有代价的,不仅很占地方,还要优先放在速度快、价格高的GPU HBM显存中。

模型参数越大、上下文越长、对话轮数越多、并发用户越多,KV Cache占用的显存也就越大。



显存太贵了,也不可能都拿来放KV Cache,还要放模型权重、激活值等等。



放不下怎么办呢,挪到便宜一点的DRAM内存和本地SSD里。

传统KV Cache扩容思路简单粗暴:GPU显存不够就增加显存,内存不够就增加内存,再用本地SSD承接溢出的缓存。



这套方法确实可以承载更长的上下文、提升推理效率,但成本会随着业务规模同步增长。

更大的问题在于,传统KV Cache通常被限制在单次对话、单块GPU或单个节点内,难以在整个集群中共享。



同时,企业部署大模型时,大量请求往往会使用同一套系统提示词、知识库、行业文档和标准模板。

不同用户提出的问题有差异,前面的公共上下文却可能高度相似,而这些公共上下文的KV Cache,却被重复缓存了。



集群规模越大,这种重复消耗也越容易被放大。

一方面,KV Cache重复消耗存储空间,另一方面存储产品(尤其显存/内存)价格涨了又涨,企业已经扩不起了。

你没想到吧,本来被拿出来提升推理效率的KV Cache,竟然成了拖后腿的大冤种。



必须要对KV Cache下手了

在这种情况下,为了提升推理效率,同时又不额外增加太多存储成本。

很多企业希望围绕KV Cache下手,进行优化↓









其实,破局的关键

是重新设计KV Cache的保存位置、复用范围和调度方式。



理儿都懂,但要商业化落地,却没有那么简单。

此时,国内顶流存储大厂中科曙光给出了解法↓

ParaCache高效管理系统

ParaCache基于存算协同理念,构建起分布式共享缓存体系。



在硬件层面,它打通显存、内存、本地SSD和集中式存储,以及分布式共享存储。

在运行层面,它让KV Cache脱离本机范畴,实现跨请求、跨GPU、跨节点复用。



这里面的关键技术有三步↓

第一步,重塑缓存池,打造出堪称业界最完整的KV Cache层级与池化。

ParaCache提供4级缓存层级,不仅有传统KV Cache包含的3级缓存(显存、内存、本地SSD),还把集中式存储FlashNexus纳入进来,替换本地SSD。



更创新的还有第4层,ParaCashe突破了传统分布式存储只能干备份的局限,让ParaStor分布式存储成为生产级L4 KV Cache共享缓存池。

ParaStor能和其他层级的缓存一样,参与KV Cahe全部跃迁行为,但成本却远远低于其他层级。



第二步,智能跃迁,给不同“温度”的KV安排最合适的位置。

访问频繁的热KV放在显存中,保证读取速度,访问频率下降的温KV进入内存,然后根据温度逐级下放到本地SSD/集中式存储→分布式存储。



当然,这种智能分层不是一成不变的。

ParaCache会通过智能稀疏、动态淘汰和层级跃迁机制,根据访问情况自动迁移缓存。



第三步,全局元数据管理,把分散的KV Cache变成整个集群的共享资源。

通过全局元数据管理,ParaCache建立了一个全局共享的“记忆池”,让计算结果在不同请求、GPU和节点之间流动起来。

并通过全局预取、预热能力,提升推理性能。



曙光ParaCache带来了什么

ParaCache带来的价值,我们可以概括为“多快好省”。

先看推理用户感受最直观的快↓

首Token时延,也就是TTFT,是推理用户判断模型快不快的直接体验指标。



在120K输入长度下,ParaCache可使单轮对话TTFT最高降低98.5%,降至400毫秒。

多轮会话TTFT降低超过80%,降至4.9秒。



再看衡量集群token生产效率的多↓

高并发场景中,大量请求共享相同的知识库、提示词和行业文档。

ParaCache让这部分公共内容只计算一次,然后KV Cache能被整个集群复用。



这样,GPU算力可以处理更多差异化Token,从而让整个集群的Token吞吐能力大大提升。



接下来看迁移上手是否好用↓

ParaCache原生兼容LMCache开源生态,企业无需大规模重构现有推理技术栈,可以保留已有技术投入,降低集群改造和系统迁移风险。



最后,面对内外存涨价压力,如何帮企业省一点↓

通过四级缓存和冷热分层,企业不必把所有KV Cache都留在高成本显存和大容量内存中。

利用集中式和分布式存储,降低推理系统对本地大内存的依赖,比如曙光搭配ParaCache专门推出FlashNexus Neo全闪,构建L3 KV Cache池。



这意味着企业有机会使用成本更低的硬件承载超长Token任务,降低单次Token生成的硬件成本和集群整体TCO。

这一回,推理成本飞涨的压力,终于能缓解了。



省硬件、降时延、提吞吐,再兼顾现有生态,这一回,曙光对KV Cache的下手,够狠也够准。

而ParaCache缓存管理系统,也是中科曙光AI数据工厂理念的一项重要技术落地。

只因,在推理时代,AI数据工厂的效率,既取决于有多少算力,也取决于能省多少算力。

Cache虽是小细节,拼的却是真功夫。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2026幼儿园“修仙”名单火了!全班名字像仙侠主角,网友:全员神仙

2026幼儿园“修仙”名单火了!全班名字像仙侠主角,网友:全员神仙

辣妈当小小
2026-09-23 08:57:15
芭蕾鞋和运动鞋生了个"混血儿",为什么今年秋天突然火了?

芭蕾鞋和运动鞋生了个"混血儿",为什么今年秋天突然火了?

山野有晚风
2026-09-23 15:35:53
笑话:深夜偷米

笑话:深夜偷米

乡村中原风
2026-09-24 20:23:19
专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

澎湃新闻
2026-09-23 07:22:28
不查不知道,一查吓一跳!75岁刘銮雄,日常近况远比外界想象奢华

不查不知道,一查吓一跳!75岁刘銮雄,日常近况远比外界想象奢华

人间烟火记事本
2026-09-23 17:44:32
北京连下六道命令拆秦岭别墅,陕西顶了四年不动,749局:我来拆

北京连下六道命令拆秦岭别墅,陕西顶了四年不动,749局:我来拆

小哥很OK
2025-11-24 22:07:07
白瞎了李富真的颜值,儿子长得还是像保镖前夫,肥头肥脑成绩很好

白瞎了李富真的颜值,儿子长得还是像保镖前夫,肥头肥脑成绩很好

照见古今
2026-09-07 17:56:09
敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

言过于诚
2026-09-21 10:04:14
“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

熙熙说教
2026-09-07 12:52:29
中国队的金牌数量断层第一,日本媒体心有不甘,自己给自己找台阶

中国队的金牌数量断层第一,日本媒体心有不甘,自己给自己找台阶

娱圈办事处
2026-09-24 15:41:35
何翔任中国医学科学院北京协和医学院党委书记

何翔任中国医学科学院北京协和医学院党委书记

医学界
2026-09-24 20:48:12
两次颁奖,都闭口不唱国歌,何诗蓓的沉默,确实很难不让人多想!

两次颁奖,都闭口不唱国歌,何诗蓓的沉默,确实很难不让人多想!

果妈聊娱乐
2026-09-24 22:18:20
俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

果妈聊娱乐
2026-08-12 08:32:47
从5260万降到390万!美媒评新赛季五大超值合同,詹姆斯无悬念第1

从5260万降到390万!美媒评新赛季五大超值合同,詹姆斯无悬念第1

锅子篮球
2026-09-24 21:43:19
你的车被“打孔机”钉了?多地车主中招,监控拍下“凶手”:毛虫趴在车上边啃边钻

你的车被“打孔机”钉了?多地车主中招,监控拍下“凶手”:毛虫趴在车上边啃边钻

听心堂
2026-09-24 09:59:02
海底捞的苦,袁记云饺不想吃了

海底捞的苦,袁记云饺不想吃了

远川消费评论
2026-09-23 23:14:28
武磊接班人诞生?国足前锋全场最佳,轰入3球:终结11场进球荒

武磊接班人诞生?国足前锋全场最佳,轰入3球:终结11场进球荒

足球狗说
2026-09-24 22:23:37
日本人也没料到,他们费尽心思举办亚运会,却反而替中国扬了名

日本人也没料到,他们费尽心思举办亚运会,却反而替中国扬了名

神秘的未知领域
2026-09-24 09:29:22
开播4集播放量破3000万!俞灏明演技惊艳,刑侦悬疑剧又出黑马

开播4集播放量破3000万!俞灏明演技惊艳,刑侦悬疑剧又出黑马

小武侃风云
2026-09-24 22:18:30
徐湖平再次火了!有人把他视频一帧一帧截下来,对着他家柜子、桌面、墙角逐件“考古”,网友怒斥:典型的靠馆吃馆

徐湖平再次火了!有人把他视频一帧一帧截下来,对着他家柜子、桌面、墙角逐件“考古”,网友怒斥:典型的靠馆吃馆

火山詩话
2026-09-19 06:29:49
2026-09-24 23:12:49
AI全球总部
AI全球总部
全球最新、最酷AI解决方案
1244文章数 716关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

教育
本地
数码
公开课
军事航空

教育要闻

开车导航出成题,能写出高分作文?导航绝不批评你,只是重新为你规划路线

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

铭凡推出UM780L Slim迷你主机:0.77L体积,板载LPDDR5X-7500

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国首架“准隐身”战斗机正式入列

无障碍浏览 进入关怀版