当大模型进入20 万、100 万上下文时代,真正拖慢推理速度的,可能已经不是 Attention,而是负责“找谁该参与 Attention”的 Index。
这是清华大学、Z.ai(智谱前身团队)最新论文《IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse》提出的核心观点。
论文聚焦于 DeepSeek Sparse Attention(DSA)这一已经应用于生产环境的稀疏注意力机制,并提出一种几乎不用修改模型结构、也几乎不增加显存的新方法,将大量重复的索引计算直接“复用”,从而进一步提升超长上下文推理效率。
![]()
论文首先指出,随着 Agent、长上下文推理、RAG 等应用兴起,大模型越来越频繁地处理数十万甚至上百万 Token。
传统 Transformer 的 Attention 计算复杂度随上下文长度平方增长,因此近年来业界普遍开始采用 Sparse Attention(稀疏注意力),例如 DeepSeek 提出的 DSA。
DSA 不再让每个 Token 与所有历史 Token 计算注意力,而是先利用一个轻量级 Lightning Indexer 找出最相关的 Top-k Token,再只计算这些 Token 的 Attention,将核心 Attention 的复杂度从 O(L²) 降低到 O(Lk)。
但一个新的瓶颈出现了。
智谱唐杰在社交媒体发文称,“DSA 让注意力变快了,却留下一笔隐性的 O(L²) 开销:indexer 每层都要重算一次。但相邻层其实在挑几乎相同的 token——大多数层根本不需要自己的 indexer。”
也就是说,当上下文越来越长时,这部分计算反而开始成为最大的耗时来源。
![]()
论文给出的数据十分直观:在 20 万 Token 上下文下,Indexer 已经占据整个 Prefill 阶段约 81% 的时间。
论文分析了 47 层 DSA 模型不同层之间选择出的Top-k Token,发现相邻层选择出的 Token 重叠率达到 70%~100%。
也就是说,大模型大量时间已经不是在思考,而是在一层又一层重复寻找几乎相同的 Token。
![]()
IndexCache 的核心思想因此非常简单:既然结果几乎一样,就不要每层都重新计算。
论文将 Transformer 层划分为两类。
第一类称为 Full Layer,保留完整 Indexer,正常计算 Top-k;第二类称为 Shared Layer,不再运行自己的 Indexer,而是直接复用最近一个 Full Layer 已经计算好的 Top-k 索引。
论文还提出了两种不同实现方式。
第一种是 Training-free IndexCache。它无需重新训练模型,而是在一小部分校准数据上,通过贪心搜索寻找哪些层应该保留 Indexer,以语言模型损失最小作为优化目标,因此能够直接部署到已有模型。
第二种是 Training-aware IndexCache。它增加了一种跨层蒸馏损失,让保留下来的 Indexer 同时学习多个层的注意力分布,从而能够支持更加激进的跨层共享,在减少更多计算的同时保持模型精度。
实验结果也是论文最大的亮点。
在一款 300 亿参数 DSA 模型上,IndexCache 移除了 75% 的 Indexer 计算,模型质量几乎没有下降;在 20 万 Token 长上下文下,Prefill 加速最高达到 1.82 倍,Decode 加速达到 1.48 倍。
![]()
作者进一步将方案验证到生产级 GLM-5 模型上。
GitHub 公布的数据表明,仅保留一半 Indexer(1/2 配置)时,GLM-5 整体端到端推理速度提升约 1.2 倍,而 LongBench、MRCR v2、GraphWalks、RULER、AA-LCR、AIME25、SciCode、IFBench 等 10 项长上下文与推理基准成绩几乎保持一致。
例如 AIME25 保持 95.9 分,RULER 为 97.3 分,HLE 保持 30.4 分,IFBench 从 71.0 仅变化至 70.0,整体精度变化极小。
更重要的是,IndexCache 并没有引入复杂的新架构。
用唐杰的话说就是,“只改了几行代码就能实现”。
根据论文和开源仓库介绍,它只是在现有 DSA 推理流程中增加了一层跨层索引复用逻辑,无需额外 GPU 显存,仅增加极少量控制逻辑即可部署到 vLLM、SGLang 等推理框架。
目前官方已经支持 DeepSeek-V3.2 与 GLM-5 等采用 DSA 架构的模型。
过去几年,大模型推理优化主要集中在 FlashAttention、KV Cache、MoE、量化等方向,而 IndexCache 的思路则说明,随着模型越来越成熟,很多性能提升已经不再来自重新设计 Transformer,而是来自发现系统内部那些长期被忽略的“重复计算”。
对于拥有几十万甚至上百万上下文的大模型而言,这类优化的价值可能会越来越高。
DeepSeek 一直在大模型优化方面思路清奇、屡有惊艳,现在智谱也加入了进来,中国 AI 在大模型基础算法上的创新空间值得期待。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.