网易首页 > 网易号 > 正文 申请入驻

突破长上下文瓶颈:72GB桌面端显卡加持下的智能体效能评测

0
分享至

出品丨奇点折射(ID:rgznai100)

AI 正在从“聊天时代”迈向“ Agent 时代”。

我们正在迎来一个多模态、长上下文、深度推理的Agent智能体时代。未来的 AI 不仅能够回答问题,还能调用工具、理解复杂任务、保持长期上下文记忆,并自主完成多步骤推理与执行。

这一趋势正在重塑 AI 基础设施需求,无论是百万级 Token 长上下文处理、多智能体协同运行,还是 RAG 知识库检索、多模态推理与本地模型微调。相较于单纯的计算性能,显存容量与显存带宽正成为本地 AI 部署的关键瓶颈。

如何选择一个高效的硬件平台?

我们打算做一系列的 AI 大模型性能测试,来评估及验证新一代 NVIDIA Blackwell 显卡对大模型的支持,尤其是对 Agentic AI 应用场景下的支持与性能表现。给大家在部署 Agentic AI 方案时,提供必要的参考与推荐信息。


硬件测试平台

硬件平台:我们选择了 Dell Precision 7960 Tower,旗舰级别的塔式工作站,可以支持我们从单张 GPU、双卡 GPU、到四卡双宽 GPU 的性能验证,同时内存还能最大扩展到 4TB DDR5,保障较大参数量的模型也能稳定加载,稳定执行从轻量级到重负载的推理任务,实现更全面地推理实验与性能验证。

GPU 选型:选择了 NVIDIA Blackwell 架构的顶级专业显卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB),也是目前最新款的桌面端专业卡。

Blackwell 架构在 AI 推理方向的技术创新是极具突破性的。采用第五代 Tensor Core,引入 FP4 精度,直接拉升了大模型推理任务的运行效率,以及整体基础设施的利用效能。PCIe 5.0 极大提高了 CPU 与 GPU 间的数据吞吐效率,GDDR7 显存带来了超高的显存带宽。显存容量的再次攀升,也使得桌面端显卡,逐步能够承载更大规模的推理任务。

NVIDIA RTX PRO™ 5000 Blackwell (72GB) 是 Blackwell 架构桌面显卡中,从显存容量、计算能力、稳定性等各维度上,能力全面、性能非常强劲的一款显卡,尤其对于Agent 执行复杂任务来说,超大显存可以原生承载更大规模的模型,支持长上下文、多模型并行加载,同时又有很强的可靠性和成本优势。


NVIDIA RTX PRO™ 5000 Blackwell

图片来源于 NVIDIA

在 Dell Precision 7960 Tower 平台上,分别搭载单卡、双卡和四卡的 NVIDIA RTX PRO™ 5000 Blackwell (72GB),即可拥有 72GB、 144GB、 288GB 的 GPU 显存容量,我们在此硬件配置下,分别适配不同的模型与智能体场景,来全面地验证 Blackwell 显卡在不同智能体任务负载下的表现。

模型选择

智能体应用中,选择合适的模型需要综合考虑任务复杂度、响应速度、效率与并发等需求。我们测试中选择了不同规模大小的模型。

测试采用原生模型精度作为基准,并未进行额外的后训练或微调,以此反映模型在真实场景下的表现,验证在 Blackwell 平台的性能输出。


测试模型

软件环境

NVIDIA Driver: 580.x+

CUDA Toolkit: 12.8+

vLLM: 0.20.0+

PyTorch: 2.10

场景选择与测试指标

我们测试采用 vllm 推理框架,选用三类梯度场景,覆盖从基础交互、主流落地到极限生产力的场景。为了贴合实际 Agent 的使用习惯,测试用例中的输入 token 数量设置为 4K、20K、40K,符号主流的智能体使用情况。

测试场景:

  • 短对话(4K 输入/ 200 输出):基准性能摸底,验证日常推理任务的稳定性。

  • 智能体任务(20K 输入/ 200 输出):模拟完整的 Agent 闭环任务,包含 Prompt 指令约束、工具调用调度、RAG 检索文本拼接、多轮对话记忆、简单数据解析等复合操作。验证日常 Agent 工作流性能。

  • 超长上下文(40K 输入/ 200 输出):智能体任务高阶场景,包括长文档分析、长日志运维研判、多轮智能体连续复盘、自动化代码编写等任务。对于显存容量、带宽、缓存调度能力要求极高。能够验证硬件在极端任务情况下的性能边界。

测试指标:

  • 首字延迟 (TTFT):收到请求到输出首个 Token 的时间。

  • P50 吞吐率:1/ITL,即平均每用户每秒生成 Token 的数量 (tokens/s),取中位数。

  • 总吞吐率:单位时间内的系统总吞吐率峰值,即所有用户在单位时间内(秒)的吞吐率之和。

智能体应用场景实测与分析

接下来,我们对各个模型进行了多场景的测试,以 DeepSeek-V4-Flash-284B-NVFP4 模型为例来,看看具体的测试数据。

DeepSeek V4 Flash-284B-NVFP4

参数量 284B,精度 NVFP4,加载全部参数,至少占用 160GB 显存大小。

所以我们配合的测试平台:Dell Precision 7960 塔式工作站 + 四张 NVIDIA RTX PRO™ 5000 Blackwell (72GB),显卡总显存为 288GB,完美支持 DeepSeek V4 Flash 原生模型的运行。

  • 测试场景 A:短对话(4K 输入 + 200 输出)


  • 测试数据报告使用 P50 (中位数)指标,包括 median_ttft(首字时延)和 median_itl(Token 间延迟),吞吐率通过 1/median_itl 计算得出;最高吞吐和平均吞吐代表 token 的总吞吐量,通过获取测试期间所有 1 秒窗口的吞吐量来计算最大值和平均值。

性能趋势图 (P50):


吞吐量时序图:

并发 8:


并发 16:


性能分析:随着并发数增加,用户的首字时延快速增加。NVIDIA RTX PRO™ 5000 Blackwell (72GB) 四卡并行时,可以比较好地支持 DeepSeek V4 Flash 短对话场景的 8-16 个并发。

  • 测试场景 B:智能体任务(20K 输入 + 200 输出)


性能趋势图 (P50):


吞吐量时序图:

并发 4:


并发 8:


性能分析:智能体应用的首字时延对用户体验影响不会特别大。在此场景中,我们更关注吞吐率。在四卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 的支持下,智能体任务的并发在 8-16 之间,体验良好。

  • 测试场景 C:超长上下文(40K 输入 + 200 输出)


性能趋势图 (P50):


吞吐量时序图:

并发 4:


并发 8:


性能分析:超长上下文对于首字时延关注略小。即使是这样较为复杂的智能体场景,四卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB)还是可以支持到 4-8 个的并发。考虑到 KV cache 的加持,实际的并发用户数量还可以再多,保守估计 10 个用户是没有问题的。

综合实测结果

根据上述方法,我们依次测试了其他模型,并根据测试结果,整理了相应的模型使用推荐及硬件适配建议。


智能体应用性能优化测试

除了硬件配置,还有一些关键的优化实践可以让智能体应用效率大幅提升,更好地释放硬件性能。

我们同样基于这台 Dell Precision 7960 塔式工作站,特别进行了 3 项性能拓展测试:

  • NVFP4 精度优化对比

  • KV Cache TurboQuant 性能增益

  • MTP 性能增益专项测试

拓展测试一:NVFP4 性能跃升

得益于 Blackwell 的张量计算支持,Blackwell 架构显卡支持 NVFP4 精度,可以在几乎不影响模型效果的前提下,相比 FP8,将模型权重显存占用减少约 75%,有效支撑翻倍的上下文长度或批处理大小。对于以长上下文处理为核心痛点的智能体应用来说, NVFP4 的价值尤为突出。DeepSeek v4 在发布时,即支持 NVFP4,在主流模型中,NVFP4 已经逐渐成为推理应用中的一个重要方向。

为了验证 NVFP4 带来的性能提升,我们选用了 Qwen3.6-35B-A3B、Gemma-4-26B-A4B 两个模型,分别进行 FP16 与 FP4 精度下的性能对比测试。

  • 测试场景:短对话(4K 输入/ 500 输出)、智能体任务 (20K 输入/ 500输出)、超长上下文场景 (40K 输入/ 500 输出) 。

  • 测试指标:吞吐率、首字时延。

Qwen3.6-35B-A3B (FP16 vs NVFP4)


Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

根据 Qwen3.6-35B-A3B 的测试结果我们可以看到,NVFP4 相比 FP16,首字时延降低约 18-20%。最高吞吐量在中高并发(8-64)区间提升显著,约为 22%-45%。在高负载的长上下文场景中,首字时延与最高吞吐量效率提升都非常明显。Qwen3.6-35B-A3B 模型在 NVFP4 的加持下,综合性能提升 20%-45%。并发数在 8 以上的时候,可以获得最佳收益。

Gemma-4-26B-A4B (FP16 vs NVFP4)


Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比

GPU: NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的首字时延对比

GPU: NVIDIA RTX PRO™ 5000 Blackwell (72GB)

在 Gemma-4-26B-A4B 模型测试中,可以发现,NVFP4 相比 FP16 的首字时延降低约 22-35%,长上下文场景中的降幅更大(34% 以上)。最高吞吐量的提高同样显著。在高负载的长上下文场景中,综合性能提升约为 40%-130%,NVFP4 带来的性能收益非常高。

综合以上模型的测试,我们认为,在 Blackwell 平台上,NVFP4 精度能大幅提升 Agent 应用的长上下文处理效率。基于此,开发者可将其作为推理任务的优选方案,以充分发挥硬件潜能,有效应对高并发、长序列的复杂场景。

拓展测试二:KV Cache TurboQuant 性能增益

当前大模型之所以占用大量的显存,根本的原因就是 KV Cahce 非常占用资源,所以业界就有了动态 KV Cache 量化压缩的做法,以节约显存。我们采用 NVIDIA TurboQuant KV Cache 量化方案,采用双卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB) GPU,主要针对 Qwen 3.6-35B-A3B 模型 (use via --kv-cache-dtype turboquant_k8v4: FP8 keys + 4-bit values, 2.6x, +1.17% PPL),对其优化前与优化后的智能体使用场景进行测试,以评估 TurboQuant 带来的性能增益。

测试场景:短对话场景(4K 输入 + 200 输出)、智能体任务场景(20K 输入 + 200 输出)与超长上下文场景(40K 输入 + 200 输出)。


Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的吞吐率对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

通过对比 TurboQuant 有无开启的情况,我们发现,KV Cache TurboQuant 主要优化的是 Prefill 阶段的性能,能够一定程度降低首字时延,这点在智能体任务与超长上下文场景中的增益最为明显。但在高并发场景下会带来吞吐率的下降,建议控制在 32 并发以内获得最佳性能。

拓展测试三:MTP 性能增益

Multi-Token-Prediction (MTP) 是为提高大模型推理的吞吐率而提出的方法。我们采用 Qwen 3.6-27B 模型,基于双卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) GPU,在以上相同的智能体应用场景中,展开对比测试。


Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的吞吐率对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

MTP 在轻负载下是提速利器,在低并发场景下开启 MTP 可获得最佳收益,例如在短对话和智能体任务场景中,并发数在 8 以内可获得 12%-60% 的吞吐率提升。在重负载场景或超高并发的情况下,则建议关闭 MTP。

不止于性能

经过多轮完整测试验证,Dell Precision T7960 工作站搭配 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 展现出了超强的智能体推理能力,突破超长上下文的性能瓶颈,并发性能出色,而且办公室使用非常友好。

即使在 GPU 满载的情况下,机器噪音可以控制在 50 分贝以内,显卡温度保持在 85 度,实现办公室静音运行。

对于成长中的开发团队来说,性价比也极具吸引力。从单卡轻量起步到四卡超大模型,配置灵活可调,轻松覆盖不同场景。无需重金投入,就能在桌面端部署顶级模型,推动 Agent 应用开发,这样的选择,何乐而不为?!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄罗斯选举结束,普京再赢五年,中方送上祝贺!欧情报局发出警告

俄罗斯选举结束,普京再赢五年,中方送上祝贺!欧情报局发出警告

青青衫书生
2026-09-24 15:32:00
央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

西楼知趣杂谈
2026-09-20 11:00:05
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
哈兰德获评9分+加冕MVP:梅开二度,助挪威3-2丹麦,迎欧国联开门红

哈兰德获评9分+加冕MVP:梅开二度,助挪威3-2丹麦,迎欧国联开门红

侧身凌空斩
2026-09-25 04:59:13
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
国家发改委:9月24日24时起国内汽、柴油价格上调395元、385元

国家发改委:9月24日24时起国内汽、柴油价格上调395元、385元

沙雕小琳琳
2026-09-25 04:59:50
俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

果妈聊娱乐
2026-08-12 08:32:47
哥哥的鲜血、父亲的教诲、10·7的火光:内塔尼亚胡为何对哈马斯、真主党和伊朗战意十足?

哥哥的鲜血、父亲的教诲、10·7的火光:内塔尼亚胡为何对哈马斯、真主党和伊朗战意十足?

寰球经纬所
2026-09-23 13:44:00
心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理观察局
2026-08-14 06:34:03
被戴8次绿帽子,3次被捉奸在床,这就是我们“玉女”守卫的爱情?

被戴8次绿帽子,3次被捉奸在床,这就是我们“玉女”守卫的爱情?

大眼妹妹
2026-09-10 11:33:45
国际油价集体收涨,布油涨2.4%重回100美元上方

国际油价集体收涨,布油涨2.4%重回100美元上方

每日经济新闻
2026-09-25 06:21:06
56岁梅拉尼娅罕见谈儿子巴伦,却难掩失落,母子关系迎来转折

56岁梅拉尼娅罕见谈儿子巴伦,却难掩失落,母子关系迎来转折

译言
2026-09-25 06:55:38
彭德怀只指挥了一年半,谁接过了抗美援朝后半程?

彭德怀只指挥了一年半,谁接过了抗美援朝后半程?

纪史行者
2026-08-02 19:08:57
岛内军事专家指出:无论是武力统一还是和平统一都已无望,因为大陆已经开启了最令人担忧的“第三条道路”

岛内军事专家指出:无论是武力统一还是和平统一都已无望,因为大陆已经开启了最令人担忧的“第三条道路”

人生录
2026-08-27 00:05:16
轻奢酒店卧室,吊带短裙配花饰高跟,出场直接惊艳全场

轻奢酒店卧室,吊带短裙配花饰高跟,出场直接惊艳全场

云端小院
2026-09-04 08:20:59
又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

汉史趣闻
2026-09-10 18:28:47
大兴机场突传大动作!砸巨资再造一座新城,南城真要彻底翻身?

大兴机场突传大动作!砸巨资再造一座新城,南城真要彻底翻身?

右耳远闻
2026-09-23 18:05:03
炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

小徐讲八卦
2026-09-17 09:49:48
叶志平:汶川地震救下2300多名师生零伤亡的校长,却只多活了3年

叶志平:汶川地震救下2300多名师生零伤亡的校长,却只多活了3年

芊芊子吟
2026-09-23 20:50:04
2026-09-25 08:28:49
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2803文章数 7736关注度
往期回顾 全部

数码要闻

雷蛇推出清姬Kiyo V2 Pro网络摄像头,支持4K 60FPS录制

头条要闻

7位退休老刑警成立工作室协助警方破案:没编制没报酬

头条要闻

7位退休老刑警成立工作室协助警方破案:没编制没报酬

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

游戏
本地
时尚
数码
公开课

R星公布《GTA6》399.99美元收藏套装 不含游戏

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

檀健次和孟子义,邀你一起来Fendi跳舞

数码要闻

Meta首款轻量化VR眼镜发布:支持IMAX Enhanced和全息通话,售1299.99美元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版