网易首页 > 网易号 > 正文 申请入驻

让KV Cache流动起来,中科曙光用ParaCache为大模型“吐字”提速

0
分享至

作者:王聪彬


使用大模型时,往往要先等待片刻,才能看到第一个Token生成。但第一个Token出现,后续内容便会持续、流畅地输出。这还要从背后一项关键的工程机制KV Cache说起。

中科曙光把提升推理效率的突破口放在了KV Cache上。8月28日,在2026中国国际大数据产业博览会期间,中科曙光提出从“存数据”到“存智能”的概念,发布新一代词元加速方案ParaCache。该方案聚焦大模型推理的Token交互场景,为企业带来计算性能提升、计算成本降低、技术生态适配三大收益。

为什么KV Cache值得专门做一套管理方案?因为一次完整的推理过程,通常可以分为Prefill和Decode两个阶段。Prefill阶段负责处理输入内容,并生成相应的KV Cache。进入Decode阶段后,模型会基于这些结果逐个生成Token,形成用户看到的连续输出。

在实际应用中,不同请求之间经常存在重复内容。如果能够保存并复用已经生成的KV Cache,模型便可以减少重复计算,释放更多GPU算力。中科曙光分布式存储产品部总经理石静表示,通过KV Cache“以存换算”,已经成为业界提升推理效率的一条重要路径。

但新的问题随之出现,KV Cache会占用大量显存,尤其是在长上下文和高并发场景下,如果全部存放在HBM中,很快就会触及容量上限。即使GPU仍有计算余力,也可能因为显存不足而无法承接更多请求,这就是大模型推理过程中常说的“显存墙”。

破解“显存墙”主要有两个方式:一是在算法和模型侧压缩KV Cache,减少其占用空间;另一个是将KV Cache从HBM卸载至容量更大的CPU DRAM、SSD或分布式存储。

因此,KV Cache需要在不同存储层级之间进行统一管理和调度,但这一过程中也出现了两个瓶颈。一是缺少全局视角,不同层级的元数据相互割裂,KV Cache难以在多个推理实例之间共享,也无法实现准确调度;二是分布式存储虽然具备共享和池化优势,但受访问延迟等因素影响,目前大多只能作为冷数据仓库使用。

ParaCache的思路,正是让KV Cache在不同存储层级和计算节点之间高效流动。

ParaCache管起整个KV Cache池

KV Cache被视为推理过程中沉淀下来、可以重复利用的“智能化数据”,需要一套贯穿不同存储层级的管理机制。

ParaCache能够统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。

从架构上看,ParaCache覆盖四个存储层级:L1对应GPU HBM,L2对应CPU DRAM,L3包括本地SSD和集中式全闪存储FlashNexus,L4是基于POSIX协议的曙光分布式存储ParaStor。“目前ParaCache已经实现L2、L3和L4的池化,并对不同层级中的KV Cache进行全局管理和动态调度,打破各层之间的元数据孤岛。”石静说道。


ParaCache通过业界主流的vLLM、SGLang等推理框架就可以无缝对接上层应用。无论采用Prefill与Decode一体化部署,还是在GPU侧对KV Cache进行分类管理,ParaCache都能够提供相应支持。

在具体的调度过程中,ParaCache还可以与推理框架的调度层配合,提前预测下一次请求所需的KV Cache。如果相关数据位于L3或L4,系统可以在请求到来前完成调取,减少数据迁移对响应时间的影响。

L3层除了常见的本地SSD,ParaCache还将面向推理场景的FlashNexus Neo集中式存储纳入这一层级,使多个计算节点能够共享同一套存储资源。实际测试显示,在延迟、吞吐量和并发请求处理等指标上,综合表现达到了本地SSD方案的两倍。

L4层是基于曙光ParaStor F9000,并进行了一系列针对KV Cache的优化。例如,首先是将部分Offset覆盖写调整为追加写,减少写入带来的延迟;其次是对分布式锁进行轻量化处理,按目录取消部分锁机制,降低强一致性和排他锁对访问效率的影响;最后在PD分离架构下仅传输增量KV Cache,从而减少集群网络带宽消耗。

ParaCache还通过XDS打通加速卡与分布式存储之间的数据通路。XDS可以同时支持GPU和国产加速卡,使KV Cache可以直接在L1与L4之间卸载和回迁,绕过CPU DRAM和本地SSD。优化使得ParaStor在L4层也能够直接参与KV Cache调度,具备承载生产级推理业务的能力。

首词元时延最高降低98.5%,词元吞吐量提升27倍

ParaCache让KV Cache从“用完即弃”的临时数据,变成可反复调用的数据资产。ParaCache带来的价值,可以概括为“多、快、好、省”。

“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。

“快”:输入约12万词元时,单轮对话开始回答前的等待时间最多可降低98.5%至0.4秒;连续20轮对话中,这一时间也降低超80%,由43.1秒降至4.9秒。

“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。

“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

KV Cache复用的价值,在多轮对话和Agent应用中更为明显。随着对话不断推进,此前生成的KV Cache可以被后续请求重复调用,从而减少重复计算。

ParaCache也进行了多轮对话场景的测试,初始输入长度分别设置为30K和120K,并在此基础上连续进行20轮对话,每轮增加0.5K输入。测试结果显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;

测试还模拟了多轮对话下的高并发请求。与KV Cache全部存放在HBM中的方案相比, ParaCache加速方案,使系统每秒处理的词元量最高达到原来的27倍。

目前,ParaCache已经进入实际业务。ParaCache支撑某头部互联网厂商的在线推理业务,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。

针对具体的行业案例,在某银行的信用卡及办卡业务中,超节点与ParaCache配合使用,使并发吞吐量提升约3倍;在教育行业的RAG知识库和智能助学场景中,部分测试的并发能力提升了15至20倍。

“从大模型训练、在线推理,到自动驾驶、具身智能和智算中心,ParaStor积累的存储实践成为ParaCache的重要基础。”石静强调。当KV Cache成为可管理、可复用的数据资产,分布式存储也由此进入大模型推理的核心链路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
开始收网了,尼日利亚没料到,中方出手第一招,就是釜底抽薪?

开始收网了,尼日利亚没料到,中方出手第一招,就是釜底抽薪?

安安说
2026-09-02 12:18:45
2-2!U20亚预赛再爆大冷,极端情况:卫冕冠军预选赛就出局!

2-2!U20亚预赛再爆大冷,极端情况:卫冕冠军预选赛就出局!

绿茵舞着
2026-09-03 23:23:08
曾被吹上天,如今却“沦为笑柄”的4个羽绒服,看谁还在乱跟风?

曾被吹上天,如今却“沦为笑柄”的4个羽绒服,看谁还在乱跟风?

鹤羽说个事
2026-09-04 00:17:03
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
特朗普:准备签和平协议了再和普京见面

特朗普:准备签和平协议了再和普京见面

看看新闻Knews
2026-09-03 10:26:05
我的相亲对象,给我讲了3小时奥特曼

我的相亲对象,给我讲了3小时奥特曼

雷斯林
2026-09-03 20:09:41
主力去英超!丹麦豪门为王钰栋腾位置,保障中国球星主力轮换

主力去英超!丹麦豪门为王钰栋腾位置,保障中国球星主力轮换

创造精彩剧情
2026-09-04 04:39:04
日元没救了,日本更没救了

日元没救了,日本更没救了

云石
2026-09-03 11:51:15
陈春江当选洛阳市委书记,他曾任陕西省副省长

陈春江当选洛阳市委书记,他曾任陕西省副省长

大风新闻
2026-09-04 10:22:13
中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方不再留台阶

中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方不再留台阶

娱乐小可爱蛙
2026-09-03 00:23:37
如果陈霞没回头检查后排,那个凌晨三点的厦门海边会发生什么?

如果陈霞没回头检查后排,那个凌晨三点的厦门海边会发生什么?

今日搞笑分享
2026-09-03 01:17:16
津媒:国足可能征召部分年轻队员,外界对布尼亚明的呼声很高

津媒:国足可能征召部分年轻队员,外界对布尼亚明的呼声很高

懂球帝
2026-09-04 08:43:02
湖北省委书记岗位被年轻人顶替,转头进海边干出中国核电的里程碑

湖北省委书记岗位被年轻人顶替,转头进海边干出中国核电的里程碑

阿天爱旅行
2026-09-04 06:19:22
阿卡逆转阿昺横扫,中西一哥二番战来啦!萨巴送油条巴多萨战高芙

阿卡逆转阿昺横扫,中西一哥二番战来啦!萨巴送油条巴多萨战高芙

网球之家
2026-09-03 12:51:53
哈马斯成立调查组,追查安全负责人为何会被以军活捉

哈马斯成立调查组,追查安全负责人为何会被以军活捉

桂系007
2026-09-03 23:58:14
北京部分出租车司机退车离场?十小时跑车难回本,怪圈怎么破

北京部分出租车司机退车离场?十小时跑车难回本,怪圈怎么破

糖逗在娱乐
2026-09-04 07:40:57
无视中韩建交承诺!韩展乱用台湾称谓,中方代表团 48 小时紧急退展

无视中韩建交承诺!韩展乱用台湾称谓,中方代表团 48 小时紧急退展

科技贵族
2026-09-04 09:27:56
大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大国之翼
2026-09-02 06:31:38
清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

小徐讲八卦
2026-09-02 09:30:37
如果我是成都蓉城,以替补迎战河南队,与天津津门虎用全主力阵容

如果我是成都蓉城,以替补迎战河南队,与天津津门虎用全主力阵容

足球分析员
2026-09-04 11:00:08
2026-09-04 11:48:50
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21532文章数 49729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

武大女教授被举报事件男方系安徽大学副校长 校方回应

头条要闻

武大女教授被举报事件男方系安徽大学副校长 校方回应

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

30.99-39.99万 价格够狠、配置够满、豪华够硬 奇瑞捷豹路虎神行者8上市即爆单

态度原创

数码
手机
本地
教育
艺术

数码要闻

三星启动Watch 7/Ultra的One UI 9测试版计划 韩国率先

手机要闻

价格太贵吓退消费者 iPhone 18 Pro或温和涨价

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

广渠门中学教育集团总校长蔡雷:比掌握工具更重要的,是学会成为真正的自己

艺术要闻

放大《汉宫春晓图》:撕掉宫斗剧滤镜,这才是明代深宫女子的真实日常

无障碍浏览 进入关怀版