网易首页 > 网易号 > 正文 申请入驻

智谱优化DeepSeek DSA:砍掉75%计算快1.8倍,唐杰说"只改了几行代码"

0
分享至

当大模型进入20 万、100 万上下文时代,真正拖慢推理速度的,可能已经不是 Attention,而是负责“找谁该参与 Attention”的 Index。

这是清华大学、Z.ai(智谱前身团队)最新论文《IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse》提出的核心观点。

论文聚焦于 DeepSeek Sparse Attention(DSA)这一已经应用于生产环境的稀疏注意力机制,并提出一种几乎不用修改模型结构、也几乎不增加显存的新方法,将大量重复的索引计算直接“复用”,从而进一步提升超长上下文推理效率。


论文首先指出,随着 Agent、长上下文推理、RAG 等应用兴起,大模型越来越频繁地处理数十万甚至上百万 Token。

传统 Transformer 的 Attention 计算复杂度随上下文长度平方增长,因此近年来业界普遍开始采用 Sparse Attention(稀疏注意力),例如 DeepSeek 提出的 DSA。

DSA 不再让每个 Token 与所有历史 Token 计算注意力,而是先利用一个轻量级 Lightning Indexer 找出最相关的 Top-k Token,再只计算这些 Token 的 Attention,将核心 Attention 的复杂度从 O(L²) 降低到 O(Lk)。

但一个新的瓶颈出现了。

智谱唐杰在社交媒体发文称,“DSA 让注意力变快了,却留下一笔隐性的 O(L²) 开销:indexer 每层都要重算一次。但相邻层其实在挑几乎相同的 token——大多数层根本不需要自己的 indexer。”

也就是说,当上下文越来越长时,这部分计算反而开始成为最大的耗时来源。


论文给出的数据十分直观:在 20 万 Token 上下文下,Indexer 已经占据整个 Prefill 阶段约 81% 的时间。

论文分析了 47 层 DSA 模型不同层之间选择出的Top-k Token,发现相邻层选择出的 Token 重叠率达到 70%~100%。

也就是说,大模型大量时间已经不是在思考,而是在一层又一层重复寻找几乎相同的 Token。


IndexCache 的核心思想因此非常简单:既然结果几乎一样,就不要每层都重新计算。

论文将 Transformer 层划分为两类。

第一类称为 Full Layer,保留完整 Indexer,正常计算 Top-k;第二类称为 Shared Layer,不再运行自己的 Indexer,而是直接复用最近一个 Full Layer 已经计算好的 Top-k 索引。

论文还提出了两种不同实现方式。

第一种是 Training-free IndexCache。它无需重新训练模型,而是在一小部分校准数据上,通过贪心搜索寻找哪些层应该保留 Indexer,以语言模型损失最小作为优化目标,因此能够直接部署到已有模型。

第二种是 Training-aware IndexCache。它增加了一种跨层蒸馏损失,让保留下来的 Indexer 同时学习多个层的注意力分布,从而能够支持更加激进的跨层共享,在减少更多计算的同时保持模型精度。

实验结果也是论文最大的亮点。

在一款 300 亿参数 DSA 模型上,IndexCache 移除了 75% 的 Indexer 计算,模型质量几乎没有下降;在 20 万 Token 长上下文下,Prefill 加速最高达到 1.82 倍,Decode 加速达到 1.48 倍。


作者进一步将方案验证到生产级 GLM-5 模型上。

GitHub 公布的数据表明,仅保留一半 Indexer(1/2 配置)时,GLM-5 整体端到端推理速度提升约 1.2 倍,而 LongBench、MRCR v2、GraphWalks、RULER、AA-LCR、AIME25、SciCode、IFBench 等 10 项长上下文与推理基准成绩几乎保持一致。

例如 AIME25 保持 95.9 分,RULER 为 97.3 分,HLE 保持 30.4 分,IFBench 从 71.0 仅变化至 70.0,整体精度变化极小。

更重要的是,IndexCache 并没有引入复杂的新架构。

用唐杰的话说就是,“只改了几行代码就能实现”。

根据论文和开源仓库介绍,它只是在现有 DSA 推理流程中增加了一层跨层索引复用逻辑,无需额外 GPU 显存,仅增加极少量控制逻辑即可部署到 vLLM、SGLang 等推理框架。

目前官方已经支持 DeepSeek-V3.2 与 GLM-5 等采用 DSA 架构的模型。

过去几年,大模型推理优化主要集中在 FlashAttention、KV Cache、MoE、量化等方向,而 IndexCache 的思路则说明,随着模型越来越成熟,很多性能提升已经不再来自重新设计 Transformer,而是来自发现系统内部那些长期被忽略的“重复计算”。

对于拥有几十万甚至上百万上下文的大模型而言,这类优化的价值可能会越来越高。

DeepSeek 一直在大模型优化方面思路清奇、屡有惊艳,现在智谱也加入了进来,中国 AI 在大模型基础算法上的创新空间值得期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
泰国官员登上“林肯”号航母​,合影中F35C简直锈成废铁

泰国官员登上“林肯”号航母​,合影中F35C简直锈成废铁

三叔的装备空间
2026-09-06 23:11:17
苹果9月9日发布会终极曝光:比折叠屏更炸的,也来了

苹果9月9日发布会终极曝光:比折叠屏更炸的,也来了

ZAKER科技
2026-09-07 10:23:29
四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

乐天闲聊
2026-09-06 23:07:19
毛主席开会时没烟了,看见邓华口袋鼓鼓的便问:你的白金龙还有没有?

毛主席开会时没烟了,看见邓华口袋鼓鼓的便问:你的白金龙还有没有?

紫罗兰侃
2026-09-05 06:45:15
“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

CSDN
2026-09-07 20:12:01
越南开国元勋武元甲晚年吐露心声:要不是黎笋一意孤行,中越两国当年本可以避免开启那场战事

越南开国元勋武元甲晚年吐露心声:要不是黎笋一意孤行,中越两国当年本可以避免开启那场战事

唠叨说历史
2026-09-02 16:24:06
宋雨琦休假归来自曝胖了5斤,此前体重跌破90斤瘦成“纸片人”引关注

宋雨琦休假归来自曝胖了5斤,此前体重跌破90斤瘦成“纸片人”引关注

韩小娱
2026-09-09 08:51:19
欧冠前瞻丨巴塞罗那4-0费耶诺德:弗里克、亚马尔正名,还看欧冠

欧冠前瞻丨巴塞罗那4-0费耶诺德:弗里克、亚马尔正名,还看欧冠

体育世界
2026-09-09 12:39:57
宋江死后,燕青带着李师师远走高飞,却生下一个贪图富贵的儿子

宋江死后,燕青带着李师师远走高飞,却生下一个贪图富贵的儿子

金宝哥讲故事
2026-09-06 00:30:05
官宣!第10座!!湖人不给詹姆斯立像就疯了!?

官宣!第10座!!湖人不给詹姆斯立像就疯了!?

柚子说球
2026-09-09 10:29:03
当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

五元讲堂
2025-08-21 15:12:14
宣布了!76人再签一人!欢迎狄龙加盟...

宣布了!76人再签一人!欢迎狄龙加盟...

詹姆斯吧
2026-09-09 12:46:50
17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

浯江孤舟
2026-08-10 10:00:15
五雷轰顶无处可逃,日本经济的终局,这个月就要见分晓

五雷轰顶无处可逃,日本经济的终局,这个月就要见分晓

华山穹剑
2026-09-08 22:30:05
中国男篮拒绝爆冷!亚运会揭幕战开门红,胡明轩挑大梁,央视直播

中国男篮拒绝爆冷!亚运会揭幕战开门红,胡明轩挑大梁,央视直播

体坛瞎白话
2026-09-08 16:39:09
嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

观察鉴娱
2026-09-09 09:30:04
上线仅一周,罗伯特·德尼罗新片观看量暴涨70%

上线仅一周,罗伯特·德尼罗新片观看量暴涨70%

浅遇时光
2026-09-09 03:47:11
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
德国选择党赢得选举,魏德尔说了2句话,72岁默克尔“重出江湖”

德国选择党赢得选举,魏德尔说了2句话,72岁默克尔“重出江湖”

临云史策
2026-09-08 16:30:05
张兰暴瘦的照片刷屏了,我想说点不一样的

张兰暴瘦的照片刷屏了,我想说点不一样的

东方不败然多多
2026-09-09 05:45:14
2026-09-09 13:08:49
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
663文章数 104关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

4岁男童被指摸臀 父亲发声:无法接受出具书面道歉要求

头条要闻

4岁男童被指摸臀 父亲发声:无法接受出具书面道歉要求

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

坦克700申报信息曝光 长轴距版轴距增150mm/首搭6座

态度原创

手机
房产
本地
公开课
军事航空

手机要闻

小米18 Fold中折叠手机相机玩法公开:两种形态,多种视角

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

本地新闻

宁波,中国制造的隐藏大佬

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版