网易首页 > 网易号 > 正文 申请入驻

首个三模式大语言模型:4倍token吞吐量,长文本秒级时代要来了?

0
分享至



编辑 | 泽南

这是一个打破传统大语言模型解码限制的研究。

英伟达提出了全球首个三模式的大语言模型系列,只需简单更改注意力模式 / 掩码,即可在自回归、扩散和自推测解码之间切换。

一个模型,三种解码模式,没有额外的草稿模型,没有架构变更。最快的模式 token 吞吐量能提升 4 倍



我们知道,传统上大语言模型主要采用的自回归解码(Autoregressive,AR)方式在低 batch sizes 时严重受内存限制,你必须为每个生成的 token 将海量权重从 HBM 移动到 SRAM。这种模式虽然准确率高,但由于无法并行,在并发量较低、追求单用户极速响应的场景(如个人 AI 助手)下,GPU 算力常常无法被充分利用,导致生成速度遭遇瓶颈。

与之相对的是,扩散模型(Diffusion Model)能够提供并行生成的能力,但由于训练时平等对待所有 token 排列,缺乏自回归模型天然的从左到右的语言先验,历史上它们的生成质量一直落后。

如果有一个模型能同时结合两者的优势,会是什么样?英伟达这项研究的核心目的,就是通过统一的模型架构消除这两种范式的隔阂,做到「准确率与速度兼得」。



  • HuggingFace:https://huggingface.co/collections/nvidia/nemotron-labs-diffusion
  • 项目页面:https://research.nvidia.com/publication/2026-05_nemotron-labs-diffusion-tri-mode-language-model-unifying-autoregressive
  • 技术报告:https://d1qx31qr3h6wln.cloudfront.net/publications/Nemotron_Diffusion_Tech_Report_v1.pdf?VersionId=db8_EMO8B.vmU26.jr7Le9pN3MqcUDNL

英伟达提出的模型不使用弱外部 MTP 模型或额外 heads,而是利用自身的扩散模式同时起草多个 token,然后在 AR 模式下使用相同的 KV cache 验证它们。这样,你就获得了扩散模型的并行生成,同时具备 AR 的严格准确性。

该方法比起之前的 Eagle/MTP 方法具有更高的接受率,无需额外权重,或者只需少量额外权重即可获得更高的接受率。



训练时,模型同时优化两个损失函数:AR Loss 和 Diffusion Loss,这完全改变了扩散语言模型质量的游戏规则。为了稳定训练,团队采用了两阶段训练策略,并引入了 Global Loss Averaging 技术,大幅降低了扩散模型训练中因随机掩码导致的梯度激增问题。

借助这种训练方式,模型在推理时可任意切换以下三种模式:

  • 自回归模式(AR Mode): 传统的从左到右逐字生成,保留完整的因果注意力机制。适合高并发、计算密集型的云端服务;
  • 扩散模式(Diffusion Mode): 采用分块去噪(Block-wise Denoising),利用双流注意力机制(Dual-stream Attention)在块内进行大规模并行 token 推测。为了进一步压榨并行的上限,英伟达还专门训练了一个轻量化采样器(Trained Sampler)来替代传统的置信度阈值判定;
  • 自猜测模式(Self-Speculation Mode): 它将传统的 Speculative Decoding(需要一个额外的小模型来垫字)改造成「单模型自我博弈」。

该研究给出了 3B、8B、14B 三个尺寸的基座模型,展现出了对现有开源自回归模型及扩散模型的全方位碾压。研究人员在之前的开源 dLLM(如 LLaDA、Dream 和 SDAR)上看到了从 9% 到 22.4% 的巨大准确率提升。也就是说,现在我们有了新的 SOTA dLLM。

在测试中,新模型匹配了 Qwen3-8B 的基线 AR 准确率,但在前向传播中达到了 5.9 个 token(TPF)。





dLLM 的主要优势在于效率。

NLD 在实际应用中的加速效果(8B 模型,单用户场景)如下:

  • DGX Spark:FP8 精度下提速 3.14 倍;INT4 精度下提速 2.7 倍(112 token/s vs 41.8 AR);
  • RTX 6000 Pro:FP8 精度下提速 3.4 倍;INT 精度下提速 2.3 倍;
  • GB200:提速 3.3 倍(850 tok/s);若配合自定义 CUDA 内核,最高可提速 4 倍。

在 SPEED-Bench 基准测试中,线性自推测(linear self-speculation)机制实现了 8.7 的平均接受长度,相比之下,Qwen3.5-9B-MTP 为 4.7,Qwen3-8B-Eagle3 为 2.81。该数据为针对数学、代码、推理及多语言任务的综合估算值。



具体方法上,这种能力并不是单个的解决方案。

在低到中等并发度下,自行推测绝对占据主导地位(非常适合个人 AI 和交互式代理)。但在巨大的批处理规模下(>64 个流),推理会变成计算受限。英伟达的解决方法是:只需将注意力掩码切换回纯 AR 模式。一个模型,在所有部署场景下都能实现通用高效。





最后,英伟达公布了他们的训练配方(从 Ministral3-3B/8B/14B 开始):

  • 1T 个 token 的 AR-only 持续预训练
  • 300B 个 token 的联合 AR + Diffusion 训练
  • 随后进行 SFT 和 VLM 对齐

使用的关键技术:

  • 全局损失平均 + DP-rank 变化掩码
  • 严格因果干净流(防止标签泄漏)
  • LoRA 增强的起草器以改进自我推测

这项研究指明了未来大模型架构演进的一个方向:不要去刻意挑选自回归还是扩散模型,将它们揉碎在同一个全连接 / 因果注意力切换的 Transformer 体系内或许才是正解。

更令人兴奋的是,论文最后的分析指出,如果未来能够开发出更完美的扩散采样器,扩散模式的理论性能上限比现有的自猜测模式还要再高出 76.5%—— 这表明扩散大语言模型依然留有巨大潜能,长文本的「秒级生成」时代可能离我们不远了。

更多细节详见论文。

参考内容:

https://x.com/PavloMolchanov/status/2056799786377039995

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
对顾城爱入骨髓,却两次嫁老头,英儿究竟是啥人?闺蜜:是只蛾子

对顾城爱入骨髓,却两次嫁老头,英儿究竟是啥人?闺蜜:是只蛾子

说历史的女人
2026-09-02 16:01:57
墙倒众人推!郭德纲事件升级后,于谦有苦难言,原来跟韩红是'同类人'

墙倒众人推!郭德纲事件升级后,于谦有苦难言,原来跟韩红是'同类人'

松林侃世界
2026-09-05 14:51:51
为啥大多数房东不待见男租户?网友:绝对不要租给小姑娘!都是泪!

为啥大多数房东不待见男租户?网友:绝对不要租给小姑娘!都是泪!

带你感受人间冷暖
2026-09-04 00:07:54
南海第一大岛易主!吹填羚羊礁对中国意味着什么?

南海第一大岛易主!吹填羚羊礁对中国意味着什么?

52赫兹实验室
2026-08-25 15:49:38
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
被要求补缴社保,老板在店门口滚屏抱怨,“选择员工需谨慎”

被要求补缴社保,老板在店门口滚屏抱怨,“选择员工需谨慎”

中国新闻周刊
2026-09-04 09:47:35
一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

熙熙说教
2026-08-31 14:59:44
养老金“特权设计”被骂上热搜,郑秉文用双轨制特权?真相不简单

养老金“特权设计”被骂上热搜,郑秉文用双轨制特权?真相不简单

青梅侃史啊
2026-07-30 22:02:45
伊朗现在的下场证明:若中美开战,75年前毛主席底牌是最佳方案!

伊朗现在的下场证明:若中美开战,75年前毛主席底牌是最佳方案!

探索新高度
2026-09-05 01:55:18
兑现豪言?23岁张本智和有望成为世界第一!最大竞争对手是松岛辉空

兑现豪言?23岁张本智和有望成为世界第一!最大竞争对手是松岛辉空

念洲
2026-09-05 14:44:04
奥运冠军杜丽现状:44岁仍韵味十足,如今从满脸痘蜕变成颜值女神

奥运冠军杜丽现状:44岁仍韵味十足,如今从满脸痘蜕变成颜值女神

巧妹电影
2026-08-18 14:41:15
我和丈夫离婚,6岁儿子流泪选爸爸,10年后我事业有成想接他同住,他却红了眼眶:妈,我爸离不开我

我和丈夫离婚,6岁儿子流泪选爸爸,10年后我事业有成想接他同住,他却红了眼眶:妈,我爸离不开我

晓艾故事汇
2026-09-04 14:07:31
孙千CP感大赏!欧豪仅排第4,井柏然屈居第2,榜首简直是“王炸”

孙千CP感大赏!欧豪仅排第4,井柏然屈居第2,榜首简直是“王炸”

喜欢历史的阿繁
2026-09-04 06:36:56
‌大连小学家长会要求穿正装,校方说只是建议,通知第一条就写着,你信吗?

‌大连小学家长会要求穿正装,校方说只是建议,通知第一条就写着,你信吗?

教育人看世界
2026-09-03 21:56:31
印度外长特别自信:不从中国手里搞到钱,印度凭什么跟中国斗?

印度外长特别自信:不从中国手里搞到钱,印度凭什么跟中国斗?

毒sir财经
2026-09-05 07:00:19
赵心童为何1 5惨败给特鲁姆普?赛后他毫不犹豫道出缘由,字字戳心

赵心童为何1 5惨败给特鲁姆普?赛后他毫不犹豫道出缘由,字字戳心

单色黎明s
2026-09-05 04:42:11
钱多有什么用,56岁带呼吸机睡的黄磊又传"噩耗",蘑菇屋终成遗憾

钱多有什么用,56岁带呼吸机睡的黄磊又传"噩耗",蘑菇屋终成遗憾

叹为观止易
2026-09-02 10:09:13
“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

闪电新闻
2026-09-05 11:21:22
突发!大牛股,被证监会立案调查,曾涉跨界收购7连涨停

突发!大牛股,被证监会立案调查,曾涉跨界收购7连涨停

数据宝
2026-09-05 08:18:43
联印遏华?上合峰会生变,俄外长警示中国当心,巴总理说出大实话

联印遏华?上合峰会生变,俄外长警示中国当心,巴总理说出大实话

烽火三月佳人三千
2026-09-05 14:49:19
2026-09-05 16:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13924文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

英伟达50多名尼泊尔员工请愿后 黄仁勋捐款1000万美元

头条要闻

英伟达50多名尼泊尔员工请愿后 黄仁勋捐款1000万美元

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

亲子
艺术
本地
家居
军事航空

亲子要闻

鸡娃不如鸡自己!经济学信号和原因 #教育孩子 #科普新锐扶持计划

艺术要闻

20幅美女油画,来自9位当代画家!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版