网易首页 > 网易号 > 正文 申请入驻

突破长上下文瓶颈:72GB桌面端显卡加持下的智能体效能评测

0
分享至

出品丨奇点折射(ID:rgznai100)

AI 正在从“聊天时代”迈向“ Agent 时代”。

我们正在迎来一个多模态、长上下文、深度推理的Agent智能体时代。未来的 AI 不仅能够回答问题,还能调用工具、理解复杂任务、保持长期上下文记忆,并自主完成多步骤推理与执行。

这一趋势正在重塑 AI 基础设施需求,无论是百万级 Token 长上下文处理、多智能体协同运行,还是 RAG 知识库检索、多模态推理与本地模型微调。相较于单纯的计算性能,显存容量与显存带宽正成为本地 AI 部署的关键瓶颈。

如何选择一个高效的硬件平台?

我们打算做一系列的 AI 大模型性能测试,来评估及验证新一代 NVIDIA Blackwell 显卡对大模型的支持,尤其是对 Agentic AI 应用场景下的支持与性能表现。给大家在部署 Agentic AI 方案时,提供必要的参考与推荐信息。


硬件测试平台

硬件平台:我们选择了 Dell Precision 7960 Tower,旗舰级别的塔式工作站,可以支持我们从单张 GPU、双卡 GPU、到四卡双宽 GPU 的性能验证,同时内存还能最大扩展到 4TB DDR5,保障较大参数量的模型也能稳定加载,稳定执行从轻量级到重负载的推理任务,实现更全面地推理实验与性能验证。

GPU 选型:选择了 NVIDIA Blackwell 架构的顶级专业显卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB),也是目前最新款的桌面端专业卡。

Blackwell 架构在 AI 推理方向的技术创新是极具突破性的。采用第五代 Tensor Core,引入 FP4 精度,直接拉升了大模型推理任务的运行效率,以及整体基础设施的利用效能。PCIe 5.0 极大提高了 CPU 与 GPU 间的数据吞吐效率,GDDR7 显存带来了超高的显存带宽。显存容量的再次攀升,也使得桌面端显卡,逐步能够承载更大规模的推理任务。

NVIDIA RTX PRO™ 5000 Blackwell (72GB) 是 Blackwell 架构桌面显卡中,从显存容量、计算能力、稳定性等各维度上,能力全面、性能非常强劲的一款显卡,尤其对于Agent 执行复杂任务来说,超大显存可以原生承载更大规模的模型,支持长上下文、多模型并行加载,同时又有很强的可靠性和成本优势。


NVIDIA RTX PRO™ 5000 Blackwell

图片来源于 NVIDIA

在 Dell Precision 7960 Tower 平台上,分别搭载单卡、双卡和四卡的 NVIDIA RTX PRO™ 5000 Blackwell (72GB),即可拥有 72GB、 144GB、 288GB 的 GPU 显存容量,我们在此硬件配置下,分别适配不同的模型与智能体场景,来全面地验证 Blackwell 显卡在不同智能体任务负载下的表现。

模型选择

智能体应用中,选择合适的模型需要综合考虑任务复杂度、响应速度、效率与并发等需求。我们测试中选择了不同规模大小的模型。

测试采用原生模型精度作为基准,并未进行额外的后训练或微调,以此反映模型在真实场景下的表现,验证在 Blackwell 平台的性能输出。


测试模型

软件环境

NVIDIA Driver: 580.x+

CUDA Toolkit: 12.8+

vLLM: 0.20.0+

PyTorch: 2.10

场景选择与测试指标

我们测试采用 vllm 推理框架,选用三类梯度场景,覆盖从基础交互、主流落地到极限生产力的场景。为了贴合实际 Agent 的使用习惯,测试用例中的输入 token 数量设置为 4K、20K、40K,符号主流的智能体使用情况。

测试场景:

  • 短对话(4K 输入/ 200 输出):基准性能摸底,验证日常推理任务的稳定性。

  • 智能体任务(20K 输入/ 200 输出):模拟完整的 Agent 闭环任务,包含 Prompt 指令约束、工具调用调度、RAG 检索文本拼接、多轮对话记忆、简单数据解析等复合操作。验证日常 Agent 工作流性能。

  • 超长上下文(40K 输入/ 200 输出):智能体任务高阶场景,包括长文档分析、长日志运维研判、多轮智能体连续复盘、自动化代码编写等任务。对于显存容量、带宽、缓存调度能力要求极高。能够验证硬件在极端任务情况下的性能边界。

测试指标:

  • 首字延迟 (TTFT):收到请求到输出首个 Token 的时间。

  • P50 吞吐率:1/ITL,即平均每用户每秒生成 Token 的数量 (tokens/s),取中位数。

  • 总吞吐率:单位时间内的系统总吞吐率峰值,即所有用户在单位时间内(秒)的吞吐率之和。

智能体应用场景实测与分析

接下来,我们对各个模型进行了多场景的测试,以 DeepSeek-V4-Flash-284B-NVFP4 模型为例来,看看具体的测试数据。

DeepSeek V4 Flash-284B-NVFP4

参数量 284B,精度 NVFP4,加载全部参数,至少占用 160GB 显存大小。

所以我们配合的测试平台:Dell Precision 7960 塔式工作站 + 四张 NVIDIA RTX PRO™ 5000 Blackwell (72GB),显卡总显存为 288GB,完美支持 DeepSeek V4 Flash 原生模型的运行。

  • 测试场景 A:短对话(4K 输入 + 200 输出)


  • 测试数据报告使用 P50 (中位数)指标,包括 median_ttft(首字时延)和 median_itl(Token 间延迟),吞吐率通过 1/median_itl 计算得出;最高吞吐和平均吞吐代表 token 的总吞吐量,通过获取测试期间所有 1 秒窗口的吞吐量来计算最大值和平均值。

性能趋势图 (P50):


吞吐量时序图:

并发 8:


并发 16:


性能分析:随着并发数增加,用户的首字时延快速增加。NVIDIA RTX PRO™ 5000 Blackwell (72GB) 四卡并行时,可以比较好地支持 DeepSeek V4 Flash 短对话场景的 8-16 个并发。

  • 测试场景 B:智能体任务(20K 输入 + 200 输出)


性能趋势图 (P50):


吞吐量时序图:

并发 4:


并发 8:


性能分析:智能体应用的首字时延对用户体验影响不会特别大。在此场景中,我们更关注吞吐率。在四卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 的支持下,智能体任务的并发在 8-16 之间,体验良好。

  • 测试场景 C:超长上下文(40K 输入 + 200 输出)


性能趋势图 (P50):


吞吐量时序图:

并发 4:


并发 8:


性能分析:超长上下文对于首字时延关注略小。即使是这样较为复杂的智能体场景,四卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB)还是可以支持到 4-8 个的并发。考虑到 KV cache 的加持,实际的并发用户数量还可以再多,保守估计 10 个用户是没有问题的。

综合实测结果

根据上述方法,我们依次测试了其他模型,并根据测试结果,整理了相应的模型使用推荐及硬件适配建议。


智能体应用性能优化测试

除了硬件配置,还有一些关键的优化实践可以让智能体应用效率大幅提升,更好地释放硬件性能。

我们同样基于这台 Dell Precision 7960 塔式工作站,特别进行了 3 项性能拓展测试:

  • NVFP4 精度优化对比

  • KV Cache TurboQuant 性能增益

  • MTP 性能增益专项测试

拓展测试一:NVFP4 性能跃升

得益于 Blackwell 的张量计算支持,Blackwell 架构显卡支持 NVFP4 精度,可以在几乎不影响模型效果的前提下,相比 FP8,将模型权重显存占用减少约 75%,有效支撑翻倍的上下文长度或批处理大小。对于以长上下文处理为核心痛点的智能体应用来说, NVFP4 的价值尤为突出。DeepSeek v4 在发布时,即支持 NVFP4,在主流模型中,NVFP4 已经逐渐成为推理应用中的一个重要方向。

为了验证 NVFP4 带来的性能提升,我们选用了 Qwen3.6-35B-A3B、Gemma-4-26B-A4B 两个模型,分别进行 FP16 与 FP4 精度下的性能对比测试。

  • 测试场景:短对话(4K 输入/ 500 输出)、智能体任务 (20K 输入/ 500输出)、超长上下文场景 (40K 输入/ 500 输出) 。

  • 测试指标:吞吐率、首字时延。

Qwen3.6-35B-A3B (FP16 vs NVFP4)


Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-35B-A3B 模型在 FP16、FP4 精度下不同场景的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

根据 Qwen3.6-35B-A3B 的测试结果我们可以看到,NVFP4 相比 FP16,首字时延降低约 18-20%。最高吞吐量在中高并发(8-64)区间提升显著,约为 22%-45%。在高负载的长上下文场景中,首字时延与最高吞吐量效率提升都非常明显。Qwen3.6-35B-A3B 模型在 NVFP4 的加持下,综合性能提升 20%-45%。并发数在 8 以上的时候,可以获得最佳收益。

Gemma-4-26B-A4B (FP16 vs NVFP4)


Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的最高吞吐量对比

GPU: NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Gemma-4-26B-A4B 模型在 FP16、FP4 精度下不同场景的首字时延对比

GPU: NVIDIA RTX PRO™ 5000 Blackwell (72GB)

在 Gemma-4-26B-A4B 模型测试中,可以发现,NVFP4 相比 FP16 的首字时延降低约 22-35%,长上下文场景中的降幅更大(34% 以上)。最高吞吐量的提高同样显著。在高负载的长上下文场景中,综合性能提升约为 40%-130%,NVFP4 带来的性能收益非常高。

综合以上模型的测试,我们认为,在 Blackwell 平台上,NVFP4 精度能大幅提升 Agent 应用的长上下文处理效率。基于此,开发者可将其作为推理任务的优选方案,以充分发挥硬件潜能,有效应对高并发、长序列的复杂场景。

拓展测试二:KV Cache TurboQuant 性能增益

当前大模型之所以占用大量的显存,根本的原因就是 KV Cahce 非常占用资源,所以业界就有了动态 KV Cache 量化压缩的做法,以节约显存。我们采用 NVIDIA TurboQuant KV Cache 量化方案,采用双卡 NVIDIA RTX PRO™ 5000 Blackwell(72GB) GPU,主要针对 Qwen 3.6-35B-A3B 模型 (use via --kv-cache-dtype turboquant_k8v4: FP8 keys + 4-bit values, 2.6x, +1.17% PPL),对其优化前与优化后的智能体使用场景进行测试,以评估 TurboQuant 带来的性能增益。

测试场景:短对话场景(4K 输入 + 200 输出)、智能体任务场景(20K 输入 + 200 输出)与超长上下文场景(40K 输入 + 200 输出)。


Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的吞吐率对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-35B-A3B 模型在不同场景下启用与未启用 TurboQuant 的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

通过对比 TurboQuant 有无开启的情况,我们发现,KV Cache TurboQuant 主要优化的是 Prefill 阶段的性能,能够一定程度降低首字时延,这点在智能体任务与超长上下文场景中的增益最为明显。但在高并发场景下会带来吞吐率的下降,建议控制在 32 并发以内获得最佳性能。

拓展测试三:MTP 性能增益

Multi-Token-Prediction (MTP) 是为提高大模型推理的吞吐率而提出的方法。我们采用 Qwen 3.6-27B 模型,基于双卡 NVIDIA RTX PRO™ 5000 Blackwell (72GB) GPU,在以上相同的智能体应用场景中,展开对比测试。


Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的吞吐率对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)


Qwen 3.6-27B 模型在不同场景下启用与未启用 MTP 的首字时延对比

GPU: 2 x NVIDIA RTX PRO™ 5000 Blackwell (72GB)

MTP 在轻负载下是提速利器,在低并发场景下开启 MTP 可获得最佳收益,例如在短对话和智能体任务场景中,并发数在 8 以内可获得 12%-60% 的吞吐率提升。在重负载场景或超高并发的情况下,则建议关闭 MTP。

不止于性能

经过多轮完整测试验证,Dell Precision T7960 工作站搭配 NVIDIA RTX PRO™ 5000 Blackwell (72GB) 展现出了超强的智能体推理能力,突破超长上下文的性能瓶颈,并发性能出色,而且办公室使用非常友好。

即使在 GPU 满载的情况下,机器噪音可以控制在 50 分贝以内,显卡温度保持在 85 度,实现办公室静音运行。

对于成长中的开发团队来说,性价比也极具吸引力。从单卡轻量起步到四卡超大模型,配置灵活可调,轻松覆盖不同场景。无需重金投入,就能在桌面端部署顶级模型,推动 Agent 应用开发,这样的选择,何乐而不为?!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
三天两次汽车袭击,以驻美大使儿子重伤,巴勒斯坦人打脸马克龙

三天两次汽车袭击,以驻美大使儿子重伤,巴勒斯坦人打脸马克龙

移光幻影
2026-09-24 09:56:50
罗杰斯:梅罗之间我更喜欢C罗,面对梅西时完全没法防住他

罗杰斯:梅罗之间我更喜欢C罗,面对梅西时完全没法防住他

懂球帝
2026-09-24 23:00:11
游本昌送别仪式月底在八宝山举行,好友称他去年年初生过一次病,之后挺过来了,最近几个月一直在住院

游本昌送别仪式月底在八宝山举行,好友称他去年年初生过一次病,之后挺过来了,最近几个月一直在住院

极目新闻
2026-09-24 13:59:38
这辈子无缘了,法媒:伊卡尔迪因违规被阿根廷禁驾至2099年

这辈子无缘了,法媒:伊卡尔迪因违规被阿根廷禁驾至2099年

懂球帝
2026-09-24 21:58:08
中美同步接到消息,普京或将缺席,APEC峰会召开前,新的混战开始

中美同步接到消息,普京或将缺席,APEC峰会召开前,新的混战开始

书写传奇
2026-09-24 02:30:36
俄罗斯大选落幕!结果出炉,接替普京的人出现?中方亮明态度

俄罗斯大选落幕!结果出炉,接替普京的人出现?中方亮明态度

嫹笔牂牂
2026-09-23 23:06:33
飞翔的荷兰人,加克波凌空绝平德国,攻入哈维时代荷兰队首球

飞翔的荷兰人,加克波凌空绝平德国,攻入哈维时代荷兰队首球

懂球帝
2026-09-25 05:15:41
山姆换回洋高管,一切都回来了!

山姆换回洋高管,一切都回来了!

广告创意
2026-09-24 17:29:27
美媒集体震惊:这次访华,才真正见识到中国温度!

美媒集体震惊:这次访华,才真正见识到中国温度!

福建睿平
2026-05-18 11:56:20
“整个人麻了”!深圳多路段堵成“猪肝红”,有人几百米开了1小时!网友:上了高速吃月饼

“整个人麻了”!深圳多路段堵成“猪肝红”,有人几百米开了1小时!网友:上了高速吃月饼

南方都市报
2026-09-24 21:40:09
他全身病痛,感觉快不行了!医生教他一招,让他多活了10年!

他全身病痛,感觉快不行了!医生教他一招,让他多活了10年!

神奇故事
2026-09-23 00:45:39
日本男乒已经“双核”了,国乒还在靠王楚钦抢2分,亚运丢冠并不冤

日本男乒已经“双核”了,国乒还在靠王楚钦抢2分,亚运丢冠并不冤

上观新闻
2026-09-24 22:09:29
斯诺克苏格兰公开赛战报出炉!中国5胜5负,10冠王遭绝杀,刘宏宇4-3取胜

斯诺克苏格兰公开赛战报出炉!中国5胜5负,10冠王遭绝杀,刘宏宇4-3取胜

生活新鲜市
2026-09-25 04:36:19
太憋屈了!网传山东一工厂中秋仅放假一天,周日强制上班至21:30,引发网友共鸣

太憋屈了!网传山东一工厂中秋仅放假一天,周日强制上班至21:30,引发网友共鸣

火山詩话
2026-09-24 18:49:31
内塔尼亚胡:5年内,追上中美

内塔尼亚胡:5年内,追上中美

环球时报国际
2026-09-24 07:55:13
华人女性加密投资人陈尸加州沙漠,死前曾发帖控诉前雇主威胁爆料

华人女性加密投资人陈尸加州沙漠,死前曾发帖控诉前雇主威胁爆料

扬子晚报
2026-09-24 22:04:43
骂战一场接一场!罗永浩警告前合伙人黄斌:等我拨出时间精力来……

骂战一场接一场!罗永浩警告前合伙人黄斌:等我拨出时间精力来……

柴狗夫斯基
2026-09-24 08:15:33
给足中方面子!战机致敬 礼炮响起 特朗普夫妇亲自迎接 挥手目送

给足中方面子!战机致敬 礼炮响起 特朗普夫妇亲自迎接 挥手目送

军武咖
2026-09-24 10:05:04
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
韩国亚运冠军甩出金牌证明已免兵役!决赛前被兵务厅询问何时回国

韩国亚运冠军甩出金牌证明已免兵役!决赛前被兵务厅询问何时回国

排球黄金眼
2026-09-24 14:56:58
2026-09-25 06:52:50
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2803文章数 7736关注度
往期回顾 全部

数码要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

数码
家居
旅游
艺术
公开课

数码要闻

罗技G PRO X3 LIGHTSPEED头戴式游戏耳麦发售,到手价1699元

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

1年幽禁7年囚居,贵阳这座不起眼的山洞,藏着两代爱国志士的遗憾

艺术要闻

看完她的油画我沉默了:风景静物美成壁纸,笔触多变,色彩清新到犯规!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版