9月20-21日,2026全球AI芯片峰会(GACS 2026)将在上海中星铂尔曼大酒店正式举行。
腾讯混元高级研发工程师王德君已确认出席,将在9月21日分会场二下午的大模型KV Cache技术研讨会带来演讲,主题为《TurboQuant在KVCache offloading的应用》。
Part.1
嘉宾介绍
![]()
王德君,腾讯混元高级研发工程师,北京大学硕士,本科毕业于东北大学。主要研究方向包括大语言模型训推加速、KVCache量化压缩、传输与调度。目前在腾讯混元负责大语言模型推理基础设施研发,主导了TurboQuant算法在Hy相关模型上的应用,并推进完成了研发和生产上线。
Part.2
报告主题
《TurboQuant在KVCache offloading的应用》
Part.3
报告概要
随着大模型上下文窗口迈入百万级,KV Cache的显存占用已成为推理系统最尖锐的内存墙瓶颈——当序列长度达128K时,其容量消耗甚至超过模型权重本身,而现有的多级缓存体系较为昂贵。更关键的是,GPU算力增速远高于显存带宽,推理耗时主要花在搬运KV Cache而非计算上。为此,腾讯混元团队将TurboQuant等在线向量量化算法引入vLLM推理框架,构建了从量化压缩到多级存储卸载的完整offloading链路。
TurboQuant是由Google Research提出、发表于ICLR 2026的在线向量量化算法。其核心创新分两阶段:PolarQuant通过极坐标变换将方向与半径解耦后分别量化,彻底去除传统per-channel缩放因子和零点的元数据开销;QJL进一步用1-bit符号编码残差,在校正误差的同时不增加存储。基于此,我们在混元Hy模型上落地了4bit量化方案——相比原有FP8方案,KV Cache占用直接减半,进而使同等硬件下的DRAM与SSD存储需求节约一倍,GPU与外部存储间的带宽消耗也同步减半。在chatbot和agent等典型场景下,如果保持存储大小不变,则可获得更大的KVCache存储效率,从而提升命中率。此外,将该算法落在offloading阶段确保了该量化方案与模型类型的充分解耦,提高了兼容性。
实际部署中,压缩后的KV Cache可从HBM卸载至DRAM、SSD乃至远程存储,得益于4bit带来的紧凑表征,更多缓存可常驻高速层,命中率在不同场景下可提升约5%~15%,长尾延迟显著降低。目前该方案已与vLLM等引擎深度集成,适配混元等主流模型。与此同时,团队也正探索更多量化算法,以适配模型结构的变化和上下文推理长度的进一步提升,为新模型和万卡集群持续降本增效。
大会日程
![]()
大模型KV Cache技术研讨会议程
![]()
参会方式
大家可以扫描下方二维码添加小助手“雪梨”进行报名参会。已添加过“雪梨”的老朋友,可以给“雪梨”私信,发送“GACS26”即可报名。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.