一个由AI开发的开源AI加速器。open TPU将auto-arch-tournament的经验引入AI加速器。它提出两个问题:AI代理在硬件设计上能走多远,它们能否构建运行自身推理的芯片?
open TPU也是一个学习项目。整个加速器位于一个小型monorepo中,您可以完整阅读:硬件设计(System Verilog)、指令集、位精确模拟器、内核语言及其编译器,以及驱动真实PCIe卡的主机软件。
该设计在Inspur YPCB-00338卡(Xilinx Kintex-7 xc7k480t,双DDR3通道)上运行十个现代模型及其真实权重,卡产生的token与模拟器逐位一致。在卡上测量:前三个模型于2026-09-29使用生产镜像deploy_champ_e698dcd7。Build B解码LFM2-2.6B、Smol LM3和Phi-4-mini比e698dcd7快8-9%,达到DRAM峰值的91-94%。
来源: Hacker News · 由HeadlinesBriefing整理摘要