HeadlinesBriefing HeadlinesBriefing 12 languages

AI is now capable of developing its own inference hardware

Hacker News ·

🇬🇧 English

An open-source AI accelerator, developed by AI. open TPU brings the lessons of auto-arch-tournament to AI accelerators. It asks two questions: how far can AI agents go at hardware design, and can they build the chip that runs their own inference?

open TPU is also a learning project. The whole accelerator lives in one small monorepo that you can read end to end: the hardware design (System Verilog), the instruction set, a bit-exact simulator, a kernel language and its compiler, and the host software that drives a real PCIe card.

The design runs ten modern models with their real weights on an Inspur YPCB-00338 card (Xilinx Kintex-7 xc7k480t, two DDR3 channels), and the card produces the same tokens as the simulator, bit for bit. Measured on the card: the first three models on 2026-09-29 with the production image deploy_champ_e698dcd7. Build B decodes LFM2-2.6B, Smol LM3 and Phi-4-mini 8-9% faster than e698dcd7, at 91-94% of the DRAM peak.

View original article →


🇸🇦 العربية

openTPU: مسرع ذكاء اصطناعي مفتوح المصدر يشغل Qwen3 على FPGA

مسرع ذكاء اصطناعي مفتوح المصدر، طورته AI. يجلب open TPU دروس auto-arch-tournament إلى مسرعات الذكاء الاصطناعي. يطرح سؤالين: إلى أي مدى يمكن لوكلاء الذكاء الاصطناعي الذهاب في تصميم الأجهزة، وهل يمكنهم بناء الشريحة التي تشغل استدلالهم الخاص؟

open TPU هو أيضًا مشروع تعليمي. يعيش المسرع بأكمله في مستودع صغير واحد يمكنك قراءته من البداية إلى النهاية: تصميم الأجهزة (System Verilog)، مجموعة التعليمات، محاكي bit-exact، لغة kernel والمترجم الخاص بها، وبرنامج المضيف الذي يقود بطاقة PCIe حقيقية.

يشغل التصميم عشرة نماذج حديثة بأوزانها الحقيقية على بطاقة Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t، قناتي DDR3)، وتنتج البطاقة نفس الرموز التي ينتجها المحاكي، بتًا بتًا. تم القياس على البطاقة: النماذج الثلاثة الأولى في 2026-09-29 مع صورة الإنتاج deploy_champ_e698dcd7. يقوم Build B بفك تشفير LFM2-2.6B وSmol LM3 وPhi-4-mini أسرع بنسبة 8-9% من e698dcd7، عند 91-94% من ذروة DRAM.

ما النماذج التي يدعمها openTPU؟

يشغل openTPU نماذج مثل Qwen3-0.6B وLFM2.5-230M وQwen3.5-0.8B وGemma 4 E2B وLFM2-2.6B وSmol LM3-3B وPhi-4-mini وQwen3.5-2B وQwen3.5-4B وGemma 4 E4B على بطاقة Kintex-7 PCIe.

العربية version →


🇧🇩 বাংলা

openTPU: ওপেন-সোর্স AI এক্সিলারেটর FPGA-তে Qwen3 চালায়

AI-নির্মিত একটি ওপেন-সোর্স AI এক্সিলারেটর। open TPU auto-arch-tournament-এর শিক্ষা AI এক্সিলারেটরে নিয়ে আসে। এটি দুটি প্রশ্ন জিজ্ঞাসা করে: AI এজেন্টরা হার্ডওয়্যার ডিজাইনে কতদূর যেতে পারে, এবং তারা কি চিপ তৈরি করতে পারে যা তাদের নিজস্ব ইনফারেন্স চালায়?

open TPU একটি শেখার প্রকল্পও। পুরো এক্সিলারেটর একটি ছোট monorepo-তে থাকে যা আপনি শুরু থেকে শেষ পর্যন্ত পড়তে পারেন: হার্ডওয়্যার ডিজাইন (System Verilog), নির্দেশনা সেট, একটি bit-exact সিমুলেটর, একটি কার্নেল ভাষা এবং এর কম্পাইলার, এবং হোস্ট সফ্টওয়্যার যা একটি বাস্তব PCIe কার্ড চালায়।

ডিজাইনটি Inspur YPCB-00338 কার্ডে (Xilinx Kintex-7 xc7k480t, দুটি DDR3 চ্যানেল) দশটি আধুনিক মডেল তাদের বাস্তব ওজন সহ চালায়, এবং কার্ডটি সিমুলেটরের মতো একই টোকেন তৈরি করে, বিট প্রতি বিট। কার্ডে পরিমাপ করা হয়েছে: প্রথম তিনটি মডেল 2026-09-29 তারিখে প্রোডাকশন ইমেজ deploy_champ_e698dcd7 সহ। Build B LFM2-2.6B, Smol LM3 এবং Phi-4-mini কে e698dcd7 থেকে 8-9% দ্রুত ডিকোড করে, DRAM পিকের 91-94% এ।

openTPU কোন মডেল সমর্থন করে?

openTPU Kintex-7 PCIe কার্ডে Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B এবং Gemma 4 E4B সহ মডেল চালায়।

বাংলা version →


🇩🇪 Deutsch

openTPU: Open-Source-KI-Beschleuniger führt Qwen3 auf FPGA aus

Ein Open-Source-KI-Beschleuniger, entwickelt von KI. open TPU bringt die Lehren von auto-arch-tournament in KI-Beschleuniger. Es stellt zwei Fragen: Wie weit können KI-Agenten beim Hardware-Design gehen, und können sie den Chip bauen, der ihre eigene Inferenz ausführt?

open TPU ist auch ein Lernprojekt. Der gesamte Beschleuniger lebt in einem kleinen Monorepo, das Sie von Anfang bis Ende lesen können: das Hardware-Design (System Verilog), der Befehlssatz, ein bit-exakter Simulator, eine Kernel-Sprache und ihr Compiler sowie die Host-Software, die eine echte PCIe-Karte antreibt.

Das Design führt zehn moderne Modelle mit ihren echten Gewichten auf einer Inspur YPCB-00338-Karte (Xilinx Kintex-7 xc7k480t, zwei DDR3-Kanäle) aus, und die Karte erzeugt dieselben Tokens wie der Simulator, Bit für Bit. Gemessen auf der Karte: die ersten drei Modelle am 2026-09-29 mit dem Produktionsimage deploy_champ_e698dcd7. Build B dekodiert LFM2-2.6B, Smol LM3 und Phi-4-mini 8-9% schneller als e698dcd7, bei 91-94% des DRAM-Spitzenwerts.

Welche Modelle unterstützt openTPU?

openTPU führt Modelle wie Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B und Gemma 4 E4B auf einer Kintex-7-PCIe-Karte aus.

Deutsch version →


🇪🇸 Español

openTPU: Acelerador de IA de código abierto ejecuta Qwen3 en FPGA

Un acelerador de IA de código abierto, desarrollado por IA. open TPU trae las lecciones de auto-arch-tournament a los aceleradores de IA. Hace dos preguntas: ¿hasta dónde pueden llegar los agentes de IA en el diseño de hardware, y pueden construir el chip que ejecute su propia inferencia?

open TPU también es un proyecto de aprendizaje. Todo el acelerador vive en un pequeño monorepo que se puede leer de principio a fin: el diseño de hardware (System Verilog), el conjunto de instrucciones, un simulador bit-exacto, un lenguaje de kernel y su compilador, y el software host que impulsa una tarjeta PCIe real.

El diseño ejecuta diez modelos modernos con sus pesos reales en una tarjeta Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t, dos canales DDR3), y la tarjeta produce los mismos tokens que el simulador, bit por bit. Medido en la tarjeta: los primeros tres modelos el 2026-09-29 con la imagen de producción deploy_champ_e698dcd7. Build B decodifica LFM2-2.6B, Smol LM3 y Phi-4-mini 8-9% más rápido que e698dcd7, al 91-94% del pico de DRAM.

¿Qué modelos soporta openTPU?

openTPU ejecuta modelos como Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B y Gemma 4 E4B en una tarjeta PCIe Kintex-7.

Español version →


🇫🇷 Français

openTPU : Accélérateur IA open source exécute Qwen3 sur FPGA

Un accélérateur IA open source, développé par IA. open TPU apporte les leçons de auto-arch-tournament aux accélérateurs IA. Il pose deux questions : jusqu'où les agents IA peuvent-ils aller dans la conception matérielle, et peuvent-ils construire la puce qui exécute leur propre inférence ?

open TPU est aussi un projet d'apprentissage. Tout l'accélérateur vit dans un petit monorepo que vous pouvez lire de bout en bout : la conception matérielle (System Verilog), le jeu d'instructions, un simulateur bit-exact, un langage de noyau et son compilateur, et le logiciel hôte qui pilote une vraie carte PCIe.

La conception exécute dix modèles modernes avec leurs poids réels sur une carte Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t, deux canaux DDR3), et la carte produit les mêmes jetons que le simulateur, bit pour bit. Mesuré sur la carte : les trois premiers modèles le 2026-09-29 avec l'image de production deploy_champ_e698dcd7. Build B décode LFM2-2.6B, Smol LM3 et Phi-4-mini 8 à 9 % plus rapidement que e698dcd7, à 91-94 % du pic DRAM.

Quels modèles openTPU prend-il en charge ?

openTPU exécute des modèles comme Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B et Gemma 4 E4B sur une carte PCIe Kintex-7.

Français version →


🇮🇳 हिन्दी

openTPU: ओपन-सोर्स AI एक्सेलेरेटर FPGA पर Qwen3 चलाता है

AI द्वारा विकसित एक ओपन-सोर्स AI एक्सेलेरेटर। open TPU auto-arch-tournament के सबक को AI एक्सेलेरेटर में लाता है। यह दो प्रश्न पूछता है: AI एजेंट हार्डवेयर डिज़ाइन में कितनी दूर जा सकते हैं, और क्या वे चिप बना सकते हैं जो उनका अपना अनुमान चलाती है?

open TPU एक सीखने की परियोजना भी है। पूरा एक्सेलेरेटर एक छोटे monorepo में रहता है जिसे आप शुरू से अंत तक पढ़ सकते हैं: हार्डवेयर डिज़ाइन (System Verilog), निर्देश सेट, एक bit-exact सिम्युलेटर, एक कर्नेल भाषा और उसका कंपाइलर, और होस्ट सॉफ़्टवेयर जो वास्तविक PCIe कार्ड चलाता है।

डिज़ाइन Inspur YPCB-00338 कार्ड (Xilinx Kintex-7 xc7k480t, दो DDR3 चैनल) पर दस आधुनिक मॉडलों को उनके वास्तविक वज़न के साथ चलाता है, और कार्ड सिम्युलेटर के समान टोकन उत्पन्न करता है, बिट-दर-बिट। कार्ड पर मापा गया: पहले तीन मॉडल 2026-09-29 को प्रोडक्शन इमेज deploy_champ_e698dcd7 के साथ। Build B LFM2-2.6B, Smol LM3 और Phi-4-mini को e698dcd7 से 8-9% तेज़ी से डिकोड करता है, DRAM पीक के 91-94% पर।

openTPU कौन से मॉडल समर्थन करता है?

openTPU Kintex-7 PCIe कार्ड पर Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B और Gemma 4 E4B जैसे मॉडल चलाता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

openTPU: Akselerator AI Sumber Terbuka Menjalankan Qwen3 di FPGA

Akselerator AI sumber terbuka, dikembangkan oleh AI. open TPU membawa pelajaran auto-arch-tournament ke akselerator AI. Ia mengajukan dua pertanyaan: seberapa jauh agen AI bisa pergi dalam desain perangkat keras, dan bisakah mereka membangun chip yang menjalankan inferensi mereka sendiri?

open TPU juga merupakan proyek pembelajaran. Seluruh akselerator berada dalam satu monorepo kecil yang dapat Anda baca dari awal hingga akhir: desain perangkat keras (System Verilog), set instruksi, simulator bit-exact, bahasa kernel dan kompilernya, serta perangkat lunak host yang menggerakkan kartu PCIe nyata.

Desain ini menjalankan sepuluh model modern dengan bobot aslinya pada kartu Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t, dua saluran DDR3), dan kartu menghasilkan token yang sama dengan simulator, bit demi bit. Diukur pada kartu: tiga model pertama pada 2026-09-29 dengan gambar produksi deploy_champ_e698dcd7. Build B mendekode LFM2-2.6B, Smol LM3, dan Phi-4-mini 8-9% lebih cepat daripada e698dcd7, pada 91-94% dari puncak DRAM.

Model apa saja yang didukung openTPU?

openTPU menjalankan model seperti Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B, dan Gemma 4 E4B pada kartu PCIe Kintex-7.

Bahasa Indonesia version →


🇯🇵 日本語

openTPU: オープンソースAIアクセラレータがFPGAでQwen3を実行

AIによって開発されたオープンソースのAIアクセラレータ。open TPUはauto-arch-tournamentの教訓をAIアクセラレータにもたらします。それは2つの質問を投げかけます:AIエージェントはハードウェア設計でどこまで到達できるか、そして自分自身の推論を実行するチップを構築できるか?

open TPUは学習プロジェクトでもあります。アクセラレータ全体は、最初から最後まで読める小さなmonorepoにあります:ハードウェア設計(System Verilog)、命令セット、ビット正確なシミュレータ、カーネル言語とそのコンパイラ、そして実際のPCIeカードを駆動するホストソフトウェア。

この設計は、Inspur YPCB-00338カード(Xilinx Kintex-7 xc7k480t、2つのDDR3チャネル)で10の最新モデルを実際の重みで実行し、カードはシミュレータと同じトークンをビット単位で生成します。カードで測定:最初の3つのモデルは2026-09-29に本番イメージdeploy_champ_e698dcd7を使用。Build BはLFM2-2.6B、Smol LM3、Phi-4-miniをe698dcd7より8〜9%高速にデコードし、DRAMピークの91〜94%で動作します。

openTPUはどのモデルをサポートしていますか?

openTPUはKintex-7 PCIeカードでQwen3-0.6B、LFM2.5-230M、Qwen3.5-0.8B、Gemma 4 E2B、LFM2-2.6B、Smol LM3-3B、Phi-4-mini、Qwen3.5-2B、Qwen3.5-4B、Gemma 4 E4Bなどのモデルを実行します。

日本語 version →


🇧🇷 Português

openTPU: Acelerador de IA de código aberto executa Qwen3 em FPGA

Um acelerador de IA de código aberto, desenvolvido por IA. open TPU traz as lições do auto-arch-tournament para aceleradores de IA. Ele faz duas perguntas: até onde os agentes de IA podem ir no design de hardware, e podem eles construir o chip que executa sua própria inferência?

open TPU também é um projeto de aprendizado. Todo o acelerador vive em um pequeno monorepo que você pode ler de ponta a ponta: o design de hardware (System Verilog), o conjunto de instruções, um simulador bit-exato, uma linguagem de kernel e seu compilador, e o software host que dirige uma placa PCIe real.

O design executa dez modelos modernos com seus pesos reais em uma placa Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t, dois canais DDR3), e a placa produz os mesmos tokens que o simulador, bit por bit. Medido na placa: os três primeiros modelos em 2026-09-29 com a imagem de produção deploy_champ_e698dcd7. Build B decodifica LFM2-2.6B, Smol LM3 e Phi-4-mini 8-9% mais rápido que e698dcd7, a 91-94% do pico de DRAM.

Quais modelos o openTPU suporta?

openTPU executa modelos como Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B e Gemma 4 E4B em uma placa PCIe Kintex-7.

Português version →


🇷🇺 Русский

openTPU: Открытый ИИ-ускоритель запускает Qwen3 на FPGA

Открытый ИИ-ускоритель, разработанный ИИ. open TPU привносит уроки auto-arch-tournament в ИИ-ускорители. Он задает два вопроса: насколько далеко могут зайти ИИ-агенты в проектировании оборудования, и могут ли они создать чип, который выполняет их собственный вывод?

open TPU также является учебным проектом. Весь ускоритель находится в одном небольшом monorepo, который можно прочитать от начала до конца: аппаратный дизайн (System Verilog), набор инструкций, бит-точный симулятор, язык ядра и его компилятор, а также хост-программное обеспечение, управляющее реальной PCIe-картой.

Дизайн запускает десять современных моделей с их реальными весами на карте Inspur YPCB-00338 (Xilinx Kintex-7 xc7k480t, два канала DDR3), и карта производит те же токены, что и симулятор, бит в бит. Измерено на карте: первые три модели 2026-09-29 с производственным образом deploy_champ_e698dcd7. Build B декодирует LFM2-2.6B, Smol LM3 и Phi-4-mini на 8-9% быстрее, чем e698dcd7, при 91-94% пиковой пропускной способности DRAM.

Какие модели поддерживает openTPU?

openTPU запускает модели, включая Qwen3-0.6B, LFM2.5-230M, Qwen3.5-0.8B, Gemma 4 E2B, LFM2-2.6B, Smol LM3-3B, Phi-4-mini, Qwen3.5-2B, Qwen3.5-4B и Gemma 4 E4B на карте Kintex-7 PCIe.

Русский version →


🇨🇳 简体中文

openTPU:开源AI加速器在FPGA上运行Qwen3

一个由AI开发的开源AI加速器。open TPU将auto-arch-tournament的经验引入AI加速器。它提出两个问题:AI代理在硬件设计上能走多远,它们能否构建运行自身推理的芯片?

open TPU也是一个学习项目。整个加速器位于一个小型monorepo中,您可以完整阅读:硬件设计(System Verilog)、指令集、位精确模拟器、内核语言及其编译器,以及驱动真实PCIe卡的主机软件。

该设计在Inspur YPCB-00338卡(Xilinx Kintex-7 xc7k480t,双DDR3通道)上运行十个现代模型及其真实权重,卡产生的token与模拟器逐位一致。在卡上测量:前三个模型于2026-09-29使用生产镜像deploy_champ_e698dcd7。Build B解码LFM2-2.6B、Smol LM3和Phi-4-mini比e698dcd7快8-9%,达到DRAM峰值的91-94%。

openTPU支持哪些模型?

openTPU在Kintex-7 PCIe卡上运行包括Qwen3-0.6B、LFM2.5-230M、Qwen3.5-0.8B、Gemma 4 E2B、LFM2-2.6B、Smol LM3-3B、Phi-4-mini、Qwen3.5-2B、Qwen3.5-4B和Gemma 4 E4B等模型。

简体中文 version →