这次数博会最让人眼前一亮的,当属中科曙光带来的 Power K 存算协同方案。
此前圈内就一直在讨论这款面向大模型时代的存算方案,今天完整看完后,只能说真没白来,这绝对是今年国产存储领域的一件大事。
![]()
为啥说它戳中了大模型的痛处?
不少开发者都吐槽,买了一堆高端显卡,结果大半算力都浪费在重复计算上,明明硬件够了,却跑不出想要的速度。
![]()
模型只能反复重新计算历史内容,相当于买了一堆显卡,却天天让它们重复做同一道题,大把时间都耗在这上面。
四级缓存池到底有多厉害?
中科曙光的 PileCache 直接把 GPU HBM、CPU 内存、本地 SSD 和分布式共享存储整合成四级缓存池。
![]()
热数据留在显存,温数据放进内存,冷数据转到 SSD 和分布式存储,KV 缓存还能长时间留存,新请求过来,已经算过的内容直接复用,只需要计算新增部分。
这就好比过去每个 GPU 都守着自己的小本本,现在曙光给整个集群建了一座共享记忆库。
![]()
同样一批显卡,过去被重复计算拖住,现在能接更多请求,产出更多 Token,像智能客服、知识库、代码助手这类需要共享大量背景资料的业务,这笔账算下来太值了。
![]()
更难得的是,PyTorch 原生兼容主流的 LM cache,原来的推理技术栈不用大改,毕竟迁移一次伤筋动骨,能平滑接入才是真正懂落地。
中科曙光在存储领域本来就有硬实力,此前 PolarDB 刚包揽 RO500 全球生产型全节点、时节点两项第一,现在又把存储能力延伸到推理赛道,相当于把存储从数据仓库,改成了 Token 生产线上的加速器。
![]()
以后再看 AI 基础设施,不能只数显卡数量了,谁能让显卡少做废活,多产 Token,谁才真正握住了推理时代的效率密码。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.