![]()
2026年8月23日,AI加速硬件创新企业d-Matrix在2026年 Hot Chips 国际高端芯片大会上,首次完整披露了旗下Raptor AI加速器的创新数据处理架构与核心技术方案。
作为一家深耕AI硬件加速领域的专精企业,d-Matrix始终聚焦内存架构革新,旨在通过颠覆性的存储与计算融合设计,大幅提升大语言模型等主流AI工作负载的运行效率,破解传统AI芯片的内存带宽瓶颈。
![]()
相较于当前AI加速器主流的“计算芯片+侧边HBM堆栈”分离式设计,Raptor采用创新的面对面垂直堆叠工艺,将台积电N4工艺打造的逻辑计算芯片,直接堆叠集成在定制化3D-DRAM内存芯片上方。d-Matrix表示,这种超短距离垂直互联架构,彻底摒弃了传统芯片与内存的长距离走线损耗,能够在显著降低数据传输功耗的同时,实现带宽性能的跨越式提升。
![]()
在硬件规格方面,Raptor 加速器集成32GB 3D-DRAM高速内存,内存带宽峰值突破100 TB/s。为直观体现技术优势,d-Matrix对比了行业主流的192GB HBM4内存方案:该方案虽拥有更大的内存容量,但其带宽仅约 18 TB/s。传统HBM架构主打大容量存储适配,而 Raptor 搭载的3D-DRAM架构,核心优势在于小容量、超高吞吐的数据高速流转,精准适配特定AI算力场景。
d-Matrix强调,这款全新加速器专为AI推理场景量身打造,并非面向消费级游戏GPU市场。目前大语言模型的推理解码阶段,普遍存在内存带宽瓶颈约束算力的行业痛点。也就是模型每生成一个新令牌,都需要反复调取模型权重数据与KV缓存数据,频繁的内存读写操作极大拖累推理速度。而这一高带宽、低延迟的内存架构,正是d-Matrix 为解决LLM解码算力受限问题打造的核心方案,将在该场景释放最大性能优势。
![]()
在核心能耗指标上,Raptor的垂直内存互联架构优势尤为突出。官方测试数据显示,其垂直数据传输能耗仅为 0.37 pJ/bit,相较之下,行业主流 HBM4 内存的单位传输能耗高达 2~3 pJ/bit,能耗优化效果十分显著。但超高带宽的功耗代价同样不容忽视:在 100 TB/s 的满速运行状态下,Raptor 仅内存I/O数据传输环节的功耗就达到296W,足以体现超高带宽数据流转的功耗成本。
d-Matrix 公布的自研硅片面积测算数据显示,对比英伟达 Rubin R200 HBM4 架构方案,Raptor 加速器单位平方毫米带宽提升约20倍,单位带宽功耗降低13.5倍。尽管该数据基于企业自研测算模型得出,尚未经过第三方独立机构性能实测认证,但清晰展现了其“内存与计算垂直融合”架构的技术迭代目标与性能潜力。
![]()
需要强调指出的是,该创新架构也绝对完美,同样存在客观短板,逻辑计算芯片与DRAM内存近距离堆叠的设计,会引发局部积热、内存刷新压力增大、长期运行可靠性下降等问题。同时,Raptor 单卡32GB的内存容量,远低于当前主流HBM架构AI加速器的容量规格。
针对上述短板,d-Matrix 配套设计了高速内存刷新机制、ECC纠错技术以及备用存储体冗余方案,有效规避架构缺陷带来的风险。因此,Raptor 并非传统HBM内存的升级迭代产品,而是一套以带宽为核心优先级、适配AI专属工作负载的全新内存计算架构,精准匹配AI推理场景“重带宽、轻容量”的算力需求。
![]()
总体而言,Raptor的亮相标志着AI推理硬件在架构探索上迈出了重要一步。它并非试图在容量上追赶HBM,而是通过重构存储与计算的物理关系,将带宽推向极致,为解码阶段的内存墙问题提供了一种截然不同的解题思路。
尽管其32GB容量和散热可靠性挑战注定了它短期内难以替代通用AI加速器,但在追求极致推理延迟的特定场景中,这种“以带宽换时间”的设计哲学有望开辟一条专属赛道。小编将在第一时间分享更多相关最新动态和爆料,敬请关注。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.