![]()
随着 AI 推理需求持续变化,针对特定工作负载定制芯片,有望在速度、功耗和成本之间取得更合适的平衡,芯片设计也成为业内热点。
一款芯片从架构规划到硬件设计、功能验证,再到固件开发和算子适配,通常需要多个团队接续完成,任何调整都可能带动后续环节重新迭代。近年来,AI 已进入布局布线、代码生成和设计空间搜索等任务,进一步连接这些环节也成为缩短芯片开发周期的一项探索。
近日,一家公司用 AI 在不到两周内完成一款推理加速器的设计、验证和部署。美国定制芯片研究公司 Architect Labs 发布了名为 Redwood 的 AI 推理加速器。公司称,两名架构师确定高层规格后,AI 系统在不到两周内完成了性能模型、RTL、验证环境、固件和计算内核等开发工作。
Redwood 主要面向机器人等物理 AI 场景,强调单批次、低功耗和低延迟推理。其缩小版本 Redwood Nano 已部署在现场可编程门阵列(FPGA)上,能够端到端运行 Qwen3-0.6B。FPGA 是一种可反复编程、常用于芯片流片前验证的硬件平台。
官网披露,Redwood 各模块的代码覆盖率和功能覆盖率均达到 95% 以上,每次架构调整均可在 48 小时内重新生成设计、完成验证并部署至硬件。Architect Labs 将其称为首款由 AI 端到端设计、能够运行现代大模型的生产级 AI 加速器。
为物理 AI 设计的加速器
机器人、自动驾驶设备和边缘终端接收到环境信息后,往往需要立即作出反应。云端服务可以积累大量请求后集中处理,这类设备却更关注单次任务的响应速度。基于这一需求,Redwood 重点优化批量为 1 时的模型推理。
从整体结构看,Redwood 是一款基于瓦片的空间数据流加速器,可以排列为 N×M 个相同的计算瓦片,外围由直接存储器访问引擎连接。多个瓦片通过定制片上网络交换数据,网络支持广播、多播和逐链路流量控制,使同一份数据能够按需送往不同计算单元。
每个瓦片都包含一颗 RISC-V 控制核心、矩阵计算引擎、向量计算引擎和 512 KB 本地存储器。矩阵引擎使用 INT8 乘加阵列,负责模型推理中计算量较大的矩阵乘法。计算结果随后直接流入向量引擎,继续完成激活函数、转置等操作,减少数据来回搬运。
![]()
图|Redwood 整体架构和单个计算瓦片结构(来源:Architect Labs 官网)
芯片与外部存储器之间的通信集中在模块化的直接存储器访问引擎中,并采用标准 AXI4 接口。按照团队的设计,这种结构使计算部分不必随外部连接方式一起改动。Redwood 既可以嵌入更大的片上系统,也可以作为独立的小芯粒使用。小芯粒是将不同功能模块分别制造,再通过先进封装组合在一起的一种芯片形态。
Redwood 还将控制前端与计算后端分开。控制逻辑可以在较低的时钟频率下运行,并在计算内核运行时关闭,以减少功耗。瓦片和直接存储器访问引擎通过硬件消息协作,预取、双缓冲和乱序计算则更多交给编译器安排,从而简化芯片内部的仲裁机制。
在具体算子上,系统也会比较不同软硬件方案。以 Softmax 为例,Redwood 没有设置专用电路,而是参考 FlashAttention-4 的模拟算法,复用已有的向量计算资源。
缩小后的 Redwood Nano 采用 2×2 瓦片配置,部署在 AMD Versal VPK180 现场可编程门阵列(FPGA)上,以 250 MHz 频率运行。端到端执行 Qwen3-0.6B 时,其速度达到每秒 12.1 个 token,测试包括提示词传入和逐 token 返回结果的过程。
![]()
图|Redwood Nano 在 FPGA 上的布局及层级结构(来源:Architect Labs 官网)
这意味着在当前 FPGA 验证平台上,Redwood Nano 已能完成小型模型的端到端推理,具备一定实时处理能力,但这一成绩仍不能直接等同于量产芯片的最终表现。
此外,Architect Labs 还将 Redwood 的设计映射到三星 8 纳米工艺,并与工艺相近的 Jetson Orin Nano 比较。预测结果显示,Redwood 的解码吞吐量为后者的 1.75 倍,功耗约为后者的 53%,性能功耗比提高 3.4 倍,面积效率预计高出一个数量级。
AI 贯通芯片开发流程
在过去,传统芯片开发通常从架构定义进入 RTL 设计,再经过功能验证、固件开发和软件适配,不同团队之间需要多次交接。
Redwood 则尝试改变这种依次推进的开发方式。其核心工具 Architect Labs Platform,简称 ALP,以人类编写的高层规格为统一依据,让硬件设计、验证和配套软件同步推进,再根据功能、面积、性能、时序和功耗反馈调整方案。AI 由此进入一套能够持续接受工程检验的开发流程。
具体而言,Redwood 的开发结合了经过后训练的模型、面向长周期任务的智能体框架,以及为 AI 构建的电子设计自动化工具。智能体调用编译器、仿真器和验证工具后,可以读取结果、定位问题并修改设计,再将新方案送回工具链接受检查,形成持续迭代的循环。
在这一流程中,人类架构师负责提出设计目标和总体约束,并维护 ALP。高层规格确定后,具体的设计、验证和软件开发工作主要由 AI 系统完成。
Architect Labs 称,Redwood 的性能模型、RTL、UVM 验证环境、SVA 断言、形式化证明、固件、驱动程序和定制计算内核均由系统生成。其中,RTL 位于架构构想与具体电路之间,用于描述数字电路如何传输和处理数据。生成 RTL,意味着 AI 需要把高层规格转化为可以综合和验证的硬件设计。
生成硬件设计后,还需要确认它能否按照规格运行,也就是芯片验证环节。其中,UVM 用于搭建测试环境,模拟不同输入和工作场景。SVA 断言把芯片必须遵守的行为写成可检查条件,形式化验证则借助数学方法,搜索电路是否存在违反条件的状态。
同时,验证也是 ALP 自动化流程的重要部分。软件可以通过更新修复问题,芯片流片后再暴露错误,则可能需要重新设计和制造。因此,测试需要尽可能覆盖不同的运行状态和路径。
围绕这一目标,ALP 会根据高层规格同步构建完整的验证环境,生成测试平台、测试用例、SVA 断言和形式化验证材料。随着验证推进,系统还会检查代码覆盖率与功能覆盖率,识别尚未触及的电路和功能,再针对薄弱环节补充测试内容,以覆盖更多设计状态。
这些验证同时使用了商业电子设计自动化工具、团队自研的形式化验证引擎和硬件在环测试。前两类工具通过运行测试和数学证明检查电路逻辑,硬件在环测试则把设计放入实际硬件环境中运行。进一步的,检查结果会重新反馈给 ALP,推动下一轮设计调整。
在验证效果方面,Architect Labs 称,从单个模块到完整芯片系统,Redwood 的代码覆盖率和功能覆盖率均达到 95% 以上。首个从仿真环境部署到 FPGA 的 RTL 版本也没有发现错误。
有了自动生成和验证能力,ALP 还可以比较更多候选设计。开发 Redwood 的 SIMD 引擎时,系统连续数日生成具有不同控制路径、数据通路和状态机的方案,再评估性能、面积、时序和代码覆盖率。相比只调整位宽或寄存器位置,这一过程可以探索结构差异更明显的微架构。
![]()
图|AI 搜索不同 SIMD 微架构的结果(来源:Architect Labs 官网)
配套的固件和计算内核也被纳入这一流程。ALP 会在 RTL 和验证材料完成前生成相关软件与性能模型,让架构师提前了解硬件选择将如何影响模型运行。这意味着一个操作应由专用电路处理,还是交给现有计算单元和软件调度,可以在架构确定前比较成本。
为了提高迭代速度,团队还建立了一套定制仿真环境,让数百个 AI 智能体共享 FPGA 资源。官网数据显示,该环境将部分优化实验从约 15 小时缩短至 15 到 30 分钟,使智能体能够在较少人工干预的情况下持续测试方案。
此外,ALP 还尝试让已经部署的模型参与后续硬件优化。Redwood Nano 在 FPGA 上运行 Qwen3 后,研究人员进一步将这一模型接入 ALP,使其参与设计方案的测试与评估,并通过反复采样发现多项时序和计算内核优化,相关结果随后被用于改进下一代 Redwood。
Architect Labs 将这一过程视为“递归自我改进”的早期尝试。按照其设想,AI 参与设计承载模型的芯片,芯片上的模型再帮助改进后续硬件。不过团队也表示,负责设计前沿硬件的 AI 系统,与能够部署在 Redwood 上的小型模型之间仍有能力差距,这一反馈闭环尚处于早期阶段。
按照公布的计划,Architect Labs 将继续提升 Redwood 对存储带宽的利用率,扩大其支持的模型规模和计算阵列,并把自动化流程延伸到物理设计、GDSII 版图生成、流片和流片后验证。
参考资料
1.https://architectlabs.com/blog/redwood
2.https://architectlabs.com
3.https://arxiv.org/abs/2608.26418
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.