网易首页 > 网易号 > 正文 申请入驻

当大模型开始按Token计价,SSD正在成为AI推理核心

0
分享至



过去几年,AI 基础设施的竞争主要围绕 GPU 和高带宽内存(HBM)展开。随着模型规模不断扩大,训练和推理需要越来越多的算力,GPU 集群、HBM 容量和互连带宽成为衡量系统能力的重要指标。

但进入长上下文、多轮对话和 AI 智能体时代,推理系统面对的问题开始发生变化。一次请求往往不仅涉及模型计算,还需要加载模型权重、读取历史上下文、检索知识、调用工具,再将结果返回模型继续推理。数据需要在 GPU、CPU、内存、存储和网络之间持续流动,只要其中任何一个环节无法及时供给数据,再强的 GPU 也只能等待。

因此,企业评估 AI 基础设施的方式也开始改变。客户真正购买的,并不是一块 GPU ,而是系统能够持续、稳定地完成推理并生成结果的能力。对于在线推理来说,真正被交付的产品,其实是 Token。

企业开始关注的不再只是拥有多少 GPU,而是相同硬件在单位时间内能够交付多少符合服务质量要求(SLO)的 Token,以及完成这些 Token 所需要付出的成本。

然而,一个 Token 的成本已经不仅由 GPU 决定,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的影响。与此同时,也不是所有 Token 都具有同样价值。只有满足首 Token 延迟(TTFT)、生成速度(TPOT)、响应质量和稳定性要求的 Token,才是真正能够交付给客户的有效 Token。

当评价标准从“买了多少 GPU”转向“交付了多少有效 Token”时,存储在推理系统中的角色也开始发生变化,其中最具代表性的便是 SSD。它正从传统的数据存储设备,逐渐成为 AI 推理基础设施的重要组成部分。

AI SSD,开始重写存储价值

相比内存,SSD 拥有更低的容量成本;相比远端对象存储,又离计算节点更近,可以保存那些暂时放不进内存、但很快还会再次使用的模型和上下文数据。

一方面,它能够承担更多模型权重、KV Cache、MoE 专家参数等运行数据,减少系统为了扩容而增加内存或 GPU 的压力;另一方面,又能够提前完成模型加载、复用已经计算过的内容,减少重复计算和等待时间,让同样数量的 GPU 在相同时间内完成更多推理请求。

这种思路已经出现在越来越多的推理系统中。例如,月之暗面(Moonshot AI)开源的 Mooncake,把 CPU、内存、本地 SSD 和高速网络组织成共享的 KV Cache 池,让不同 GPU 可以直接复用已经计算好的上下文,而不必重新计算。


(来源:月之暗面)

还有 ServerlessLLM 将本地 SSD 纳入模型调度,在模型启动前提前完成加载,减少冷启动等待;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,则通过复用已经计算好的 KV Cache 或共享 Prefix,避免相同内容反复执行 Prefill。从某种意义上说,这些系统缓存的不只是数据,也是在保存已经付出过的计算结果。

当然,把 SSD 放进推理系统,并不意味着 Token 成本一定会下降。如果缓存没有命中,系统仍然需要重新读取甚至重新计算;预取策略不合理,还可能占用宝贵的 PCIe 带宽和内存空间。因此,评价 AI SSD 不能只看带宽、IOPS 等传统存储指标,更重要的是它是否能够缩短模型启动时间、提高缓存命中率、减少 GPU 等待,并最终让整个推理系统以更低成本交付更多满足服务要求的 Token。

消费级和企业级,AI SSD 是两种生意

不过,AI SSD 的价值并不会体现为一种统一的产品形态。不同的部署环境和客户群体,面临的瓶颈并不相同,对存储的需求自然也会有所差异。

从目前来看,AI SSD 很可能沿着两条市场路线发展:一条面向消费级市场,服务 AI PC、工作站等端侧设备;另一条面向企业级市场,服务边缘计算和云端 AI 推理基础设施。

对于消费级用户来说,最大的挑战是在有限的内存和功耗条件下,让设备运行更大的模型、保存更多本地知识,并在离线状态下继续使用 AI。消费级 AI SSD 最现实的形态,仍然是一块安装在 AI PC、工作站等设备中的固态硬盘。它依然承担系统盘和数据盘的功能,但会进一步加入面向 AI 的数据管理能力,让模型、缓存和用户数据能够更高效地保存在本地,而不需要改变现有 PC 的硬件架构。

苹果在《LLM in a Flash》中展示过一种思路:把大部分模型参数保存在 Flash 存储中,需要计算时再按需加载到内存。沿着这一思路,AI SSD 不仅可以存放大模型本身,还可以保存多个专业模型、个人知识库、AI 助手的长期记忆,以及暂时不用的数据,让系统根据不同任务动态组合所需内容,而不用一直占用宝贵的内存。

消费级 AI SSD 带来的首先是本地 AI 的可用性。会议记录、文档检索、代码生成、个人知识库等任务,不需要每次都重新从云端下载模型或上传数据,在网络较差甚至离线的情况下,仍然能够完成一部分工作,同时减少网络传输和云端推理成本。当然,数据保存在本地并不意味着天然安全,权限管理、数据加密和安全删除等机制仍然不可或缺。

企业级市场则完全是另一套逻辑。企业客户购买的不是一块 SSD,而是整个 AI 推理系统的效率。无论部署在企业边缘节点还是云端数据中心,更重要的问题都是如何减少 GPU 等待、提高 GPU 利用率,并持续降低每个 Token 的生成成本。

在企业边缘,AI SSD 可以帮助设备在弱网甚至离线环境下运行模型,支撑工厂、门店、医院等场景的本地 AI 应用;而在云端数据中心,它承担的角色则更加重要。本地 SSD 可以缓存模型和检查点(Checkpoint),减少反复从远端对象存储加载;机架或服务器集群中的共享 Flash 存储,则可以保存仍有复用价值的推理数据,让不同 GPU 在处理相似请求时直接利用已有结果,而不必重复计算。


图|消费级与企业级AI SSD在端侧和云侧的典型角色。

这一思路也已经开始进入商业产品。英伟达推出的 CMX Context Memory Storage,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间增加了一层基于 Flash 的上下文存储,用来保存暂时放不下、但仍有复用价值的数据。它并不是让每一次推理都访问 SSD,而是尽量把这些数据保留在离 GPU 更近的位置,需要时能够快速取回,从而减少数据搬运带来的等待时间。


图|CMX Context Memory Storage(来源:英伟达)

虽然都叫 AI SSD,但消费级和企业级产品解决的是两类完全不同的问题。消费级 AI SSD 关注的是本地 AI 能力,让设备能够运行更大的模型、保存更多个人知识,并提升离线体验;企业级 AI SSD 关注的则是整个推理系统的效率,通过减少模型加载和数据等待,提高 GPU 利用率,降低每个 Token 的生成成本。未来,这两条路线很可能长期并存,并分别沿着端侧设备和云端推理基础设施不断演进。

AI SSD,开始出现不同的产业路径

面对不同的应用场景,厂商们也开始沿着各自擅长的方向进入这一市场。有人希望提供完整的 AI 部署方案,有人从 SSD 控制器出发,让存储主动参与推理,也有人尝试同时打通计算和存储两侧,共同定义下一代 AI SSD。

群联(Phison)选择的是第一条路径。其 aiDAPTIV 将 SSD、中间件和部署工具组合在一起,通过分层管理模型权重,让超过显存容量的大模型也能够运行在消费级 GPU 上。相比单独销售一块 SSD,它交付的是一整套 AI 部署方案,客户不需要从裸设备重新搭建推理环境。最终,这类产品的竞争力仍然要落到可运行模型规模、启动时间、Token 吞吐、兼容性和整体部署成本等指标上。

江波龙则把重点放在 SSD 本身。其提出的 SPU+iSA 架构,希望把压缩、缓存、混合介质管理和智能预取等能力进一步放到存储侧,让 SSD 从被动响应 I/O,逐渐成为能够参与运行时数据管理的主动存储组件。进一步来看,这一思路也指向一种更加主动的 AI 存储节点:存储不仅负责保存数据,也开始参与模型、KV Cache 和专家参数等数据对象的组织、迁移与调度。当然,目前公开的数据主要来自厂商资料,不同方案之间仍缺乏统一的第三方评测,因此更适合作为一种产品方向来观察。

寅谱(Infplane)与联芸科技(Maxio Technology)的合作,则更强调计算和存储的协同设计。

联芸长期深耕 SSD 控制器、固件和闪存管理,并公开提出 AI 推理的价值尺度正逐渐从容量和价格,转向每 Token 成本和系统能效;寅谱则从 AI 芯片、Runtime 和操作系统切入,希望把模型运行过程中的调度信息更快传递到控制器和固件。

在之前提到的几种方案中,寅谱也是唯一从 AI 计算与系统软件出发的 AI Native 企业,其优势在于能够把模型和 Runtime 的需求直接映射到控制器、固件、NAND 管理以及 OEM 参考设计,让存储系统与推理框架形成更紧密的协同,而不仅仅停留在存储性能优化层面。


图|推理参与型AI SSD探索:群联aiDAPTIV、江波龙SPU+iSA

另一类产品则更接近传统企业级 SSD 的演进路线。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,主要围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),为模型加载、KV Cache、向量数据库和推理数据层提供更加稳定的存储基础。它们并没有改变 SSD 在系统中的基本角色,而是在现有架构下进一步提升企业级存储能力。


图|英韧科技洞庭N3X与华为OceanDisk LC 560。

这些探索并不是彼此取代,而是分别覆盖 AI 推理系统的不同层次。有人负责把 AI 更容易部署起来,有人负责让存储更主动地参与推理,也有人继续夯实底层存储能力。随着 AI 推理规模持续扩大,这些能力很可能在同一套系统中融合,共同服务于一个目标:让相同的算力交付更多有效 Token。

从目前的发展来看,AI SSD 的价值正在不断延伸。最初,它帮助内存有限的设备运行更大的模型;随后,它开始保存模型缓存、上下文和其他可复用的数据,减少重复计算和数据搬运;未来,它还可能进一步成为端侧和云侧 AI 存储节点中的核心组成部分,在模型加载、上下文管理和推理调度中承担更加主动的角色。不过,无论产品形态如何变化,兼容现有硬件和软件生态,仍然是 AI SSD 大规模普及的重要前提。

它在端侧和云侧的发展重点也会有所不同。在端侧,AI SSD 的价值主要体现在支持更大的本地模型、更丰富的个人知识库、更好的离线体验,以及减少对云端推理的依赖;在云侧,它更关注模型冷启动、上下文复用、GPU 利用率以及每 Token 成本等推理基础设施指标。随着端、边、云协同不断成熟,未来计算任务也可能根据成本、时延、隐私和数据位置,在终端设备、边缘节点和云端之间动态分配。

从更长远的角度来看,AI SSD 争夺的并不仅仅是存储市场中的一个新品类,而是 AI 推理基础设施中的一个新角色。它既要以远低于内存的成本保存更大的智能工作集,又要比传统共享存储更高效地服务模型推理,把模型加载、上下文复用和弹性启动带来的效率提升,最终转化为更多有效 Token。

过去,人们评价一块 SSD,看的是容量、带宽和 IOPS;未来,衡量 AI SSD 的标准可能会变成另一组指标:它是否能够让相同数量的 GPU,在相同的时间和功耗下,交付更多满足服务要求的 Token。如果能够证明这一点,AI SSD 才有机会从一块“面向 AI 的高端硬盘”,真正成为下一代 AI 推理基础设施的重要组成部分。

1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/

2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/

3.https://www.usenix.org/conference/fast25/presentation/qin

4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html

5.https://www.usenix.org/conference/osdi24/presentation/fu

6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost

7.https://machinelearning.apple.com/research/efficient-large-language

8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/

9.https://docs.vllm.ai/en/stable/design/prefix_caching/

10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/

11.https://cn.longsys.com/about/news/13353.html

12.https://www.maxio-tech.com/news/11645/13048.html

13.https://www.eeo.com.cn/2025/1222/774317.shtml

14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/

15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
果不其然,中方前脚撤完人,李在明后脚找茬,逼中国修改涉韩表述

果不其然,中方前脚撤完人,李在明后脚找茬,逼中国修改涉韩表述

影孖看世界
2026-09-04 21:41:44
德国的强硬回击,让俄罗斯绷不住了

德国的强硬回击,让俄罗斯绷不住了

山河路口
2026-09-03 22:42:02
皇马1-1贝蒂斯:穆帅首秀遭绝平,姆巴佩罚失关键点球

皇马1-1贝蒂斯:穆帅首秀遭绝平,姆巴佩罚失关键点球

带你逛体坛
2026-09-05 16:53:40
真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

一盅情怀
2026-09-03 11:22:44
某博主:星宇股份风波属于内部矛盾,咱们要抵制外部势力借个案炒作!结果评论区十分清醒

某博主:星宇股份风波属于内部矛盾,咱们要抵制外部势力借个案炒作!结果评论区十分清醒

谭谈社会
2026-09-04 13:27:03
越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

铁锤妹妹是只猫
2026-09-04 22:27:16
千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

户外阿毽
2026-09-03 13:17:36
男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

浙江卫视
2026-09-03 14:13:05
伊朗婚礼现场遭袭致5人死亡、近70人受伤,专家:很可能是美国武器,而非失误的伊朗防空导弹,该武器可能是偏离了目标

伊朗婚礼现场遭袭致5人死亡、近70人受伤,专家:很可能是美国武器,而非失误的伊朗防空导弹,该武器可能是偏离了目标

鲁中晨报
2026-09-04 09:22:02
张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

蓓小西
2026-09-05 09:00:14
女篮世界杯出线形势!中国队33分惨败晋级无忧:中日韩3队或携手出线

女篮世界杯出线形势!中国队33分惨败晋级无忧:中日韩3队或携手出线

篮球快餐车
2026-09-05 03:12:18
伊朗媒体称哈尔克岛附近传出爆炸声

伊朗媒体称哈尔克岛附近传出爆炸声

新华社
2026-09-05 14:47:07
山西惜败北京!刘传兴32+13空砍,张宁持续低迷,赵嘉仁哑火!

山西惜败北京!刘传兴32+13空砍,张宁持续低迷,赵嘉仁哑火!

篮球资讯达人
2026-09-05 19:35:48
传玛莎拉蒂与华为、江淮合作,2027年推出基于尊界的电动车

传玛莎拉蒂与华为、江淮合作,2027年推出基于尊界的电动车

观察者网
2026-09-05 14:37:20
顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

乌克兰小静
2026-09-05 08:36:07
10点!CCTV5直播男篮亚运揭幕战,赢球希望大?19岁新星期盼亮相

10点!CCTV5直播男篮亚运揭幕战,赢球希望大?19岁新星期盼亮相

盛夏微凉
2026-09-05 10:06:09
全国唯一拥有两所“211”高校的县级市迎来5500多名新生

全国唯一拥有两所“211”高校的县级市迎来5500多名新生

21世纪经济报道
2026-09-03 16:25:55
赶在发布会前!运营商晒iPhone 18 Pro/Ultra售价:苹果这涨幅并不激进

赶在发布会前!运营商晒iPhone 18 Pro/Ultra售价:苹果这涨幅并不激进

快科技
2026-09-05 12:44:35
28.99万 !现代汽车正式上市!

28.99万 !现代汽车正式上市!

科技堡垒
2026-09-04 10:45:57
重庆市市三名干部被查处

重庆市市三名干部被查处

江津融媒
2026-09-05 11:24:18
2026-09-05 20:07:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17195文章数 515201关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

亲子
本地
房产
数码
公开课

亲子要闻

“你该长大了”,宝妈撒娇痛哭,不愿走1.5公里送娃上学,力竭了

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

房产要闻

嘉禾郡|全新样板间盛大开放|三重豪礼解锁,至高可省20万!

数码要闻

IFA2026现场直击:绿联双馆齐发,AI全家桶抢占C位

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版