近日,由 Ebrahim Hussain 和 Aaditya Subedi 领导的定制芯片人工智能研究实验室 Architect Labs 宣布了一项重大突破:其人工智能系统成功自主设计并完全验证了一款名为 Redwood 的端到端、可量产的人工智能加速器。这一成果仅由两位人类架构师提供技术规范,AI 系统便在不到两周的时间内完成了从芯片设计、全面验证到固件和内核开发的全过程。目前,Redwood 已部署在 FPGA 平台上,能够对包括 Llama 和 Qwen 在内的数十亿参数模型进行推理。
Redwood 的问世标志着半导体行业的一个重要里程碑:这是首个由人工智能系统自主设计,并能在真实硬件上运行现代 AI 模型的量产型芯片。这种方法在人工智能模型与优化硬件之间建立了一个正向反馈回路,有望将芯片设计速度提升至超越传统开发周期的水平。性能测试数据表明,Redwood 不仅仅是一个概念验证。基于三星 8nm 工艺,Redwood 的吞吐量达到了 NVIDIA Jetson Orin Nano 的 1.75 倍,功耗却降低了 1.9 倍,这意味着在相同 AI 模型下,其每瓦性能提升了 3.4 倍。传统芯片设计往往需要耗费数年时间、数亿美元资金,且面临专业人才日益短缺的困境,导致 AI 工作负载往往需要适配远早于最新型号问世设计的硬件。而 Redwood 采取了截然不同的协同设计方法,从一开始就将硬件与软件进行并行开发与优化,使芯片能够根据 AI 工作负载进行定制,而非强迫软件去适应僵化的硬件架构。这种持续的反馈循环使得改进的 AI 模型可以为更好的硬件设计提供信息,更高效的硬件则能实现更优的 AI 性能,从而加速开发周期。
**走进 Redwood:前沿 AI 加速器**
Redwood 是一款专为物理 AI 应用设计的端到端推理平台,例如机器人、无人机和边缘设备,这些应用对实时性能和严格的功耗限制有着极高的要求。其核心是一个可扩展的矩阵和向量计算引擎网格,通过专用的片上网络相互连接。完整的 AI 推理流程,包括注意力机制、键值缓存和即时量化,均直接在芯片上运行,无需依赖主机处理器。计算引擎、网络、固件和定制内核作为一个统一系统进行设计和优化,使硬件能紧密匹配现代 AI 工作负载。Redwood 还可扩展为更大的数据中心 SoC 或独立芯片组。
**关键数据:自主设计与验证**
Redwood 的自主设计实现了多项关键数据:
* **全流程自动化**:100% 的 RTL 代码、UVM 验证环境、形式化验证、固件、驱动程序和自定义计算内核均由 AI 系统在不到两周内生成,且无需人工干预。
* **零缺陷验证**:每个模块的代码和功能覆盖率均超过 95%,从仿真到 FPGA 部署均未发现任何硬件缺陷。
* **真实模型运行**:Redwood Nano 部署在 AMD Versal FPGA 上,运行频率为 250MHz,可对包括 Qwen 在内的开放权重模型执行实时单批次推理。
* **超越现有竞品**:在相同的三星 8nm 工艺下,Redwood 的吞吐量比 Jetson Orin Nano 提升 1.75 倍,功耗降低 1.9 倍,每瓦性能提升 3.4 倍。
* **极速迭代**:架构变更可在 48 小时内完成重新生成、重新验证和重新部署。
**一种根本性的硅芯片软件设计方法**
Architect Labs 的 AI 系统能够并行优化整个计算堆栈,从模型和内核到固件和 RTL 代码,而非采用传统设计中常见的顺序、孤立的工作流程。这使得软件和芯片能够在流片过程中进行协同优化,设计迭代时间从数月缩短至数周。这种方法允许根据效率在软件和硬件之间灵活切换功能,例如用专用硬件逻辑替换数千个软件周期,或将调度任务移至编译器。Redwood 证明了这些权衡取舍现在可以在几天内完成设计、验证和测试。
Architect Labs 联合创始人兼首席执行官 Ebrahim Hussain 表示:“三十年前,晶圆代工厂让任何拥有设计方案的人都能获得世界一流的制造能力,催生了无晶圆厂半导体产业。同样,我们正在引领‘无设计半导体产业’的发展,像 Redwood 这样的芯片可以与运行的工作负载共同设计和演进。我们设想,拥有密集型工作负载的软件公司可以获得共同设计的定制芯片,而无需组建庞大的设计团队或退而求其次使用通用解决方案。”
**架构与实现细节**
Redwood 采用基于 Tile 的空间数据流架构,使用标准的 AXI4 内存映射接口。它包含全局控制区域和计算架构区域。全局控制区域负责排序和协调,包含全局任务管理器和定时器。计算架构是一个 N × M 的网格,由相同的 Tile 组成,每个 Tile 包含一个基于 RISC-V 的控制核心和专为 Transformer 推理设计的计算引擎。矩阵引擎提供脉动 GEMM 和矩阵向量数据通路,向量引擎提供 SIMD 和转置功能。高带宽、基于信用机制的片上网络连接各个 Tile 和 DMA 引擎,实现高效的数据传输。
**递归式自我改进**
Architect Labs 表示,已将同样的方法应用于财富 500 强合作伙伴,以软件开发的速度共同设计定制芯片。Redwood 的一个重要特性是递归式自我改进:部署在 Redwood 上的 AI 模型以 API 端点形式公开,能够发现加速器本身的计时和内核优化,从而闭合 AI 和驱动它的硅芯片之间的闭环。这是迈向递归式自我改进的早期一步:一个 AI 系统设计了一个 AI 加速器,在其上部署了一个 AI 模型,并利用该模型改进了下一代加速器。
**结论**
Redwood 是首个由 AI 系统端到端设计并运行现代 AI 模型的、可用于生产环境的 AI 加速器。它证明了硬件和软件可以同步演进。传统的顺序芯片设计流程中,AI 辅助并未显著缩短端到端开发时间,而 Architect Labs 的系统通过正交方法,实现了架构、RTL、验证、固件和内核的协同设计与优化。这种以高级规范为源头的自动化流程,使得架构变更能够在 48 小时内重新验证并部署。未来的工作将致力于弥合内存容量与性能上限之间的差距,并扩展 AI 系统,以实现智能的泛滥和 AI 驱动的硬件持续进化。
