它背后有沉重的计算、显存和带宽成本,也逼迫模型架构从传统注意力走向更复杂的取舍。Transformer 的核心问题在于,全局自注意力要求每个 token 与其他 token 建立关系。
输入越长,计算和缓存压力增长越快。预填阶段要处理大量 token 之间的相互关系,解码阶段还要不断读取过去的 Key-Value 缓存。
![]()
第一条是优化传统注意力,通过 FlashAttention、分页缓存、量化和更好的内存管理降低浪费。它不改变数学结构,但能延缓瓶颈。
第二条是稀疏注意力,让模型只关注部分关键位置,用近似结构换效率。第三条是线性或循环机制,把过去信息压缩进固定状态,降低缓存增长。
这些方案没有绝对赢家。稀疏会损失细节,压缩会带来遗忘,检索依赖索引质量,摘要可能丢掉关键线索。
![]()
系统需要判断哪些信息进入注意力,哪些信息进入长期记忆,哪些内容应被压缩,哪些必须逐字保留。AI 代理要连续执行任务,更需要可靠的状态管理和错误恢复,而不是把所有历史一股脑塞进提示词。
![]()
这也意味着,未来模型评测不能只比窗口长度。更关键的指标,是长任务中是否能稳定找到关键事实,是否会被无关段落干扰,是否能在多轮操作后保留正确状态。
该结果属于特定模型配置下的估算,并非H100或70B模型的通用基准。因此,行业才会尝试压缩 KV 缓存。
DeepSeek-V2 的多头潜在注意力(MLA)把 Key 和 Value 联合压缩到低维潜在表示,推理时主要缓存这一压缩表示,并通过矩阵吸收等方式避免保存完整KV。
![]()
官方报告显示,与DeepSeek 67B相比,其实际部署方案将KV Cache减少93.3%,最大生成吞吐提高到5.76倍。
需要注意,5.76倍是DeepSeek-V2整套架构和FP8、KV量化等部署优化共同作用下,相对于DeepSeek 67B得到的结果,不能全部归因于MLA本身。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.