HeadlinesBriefing favicon HeadlinesBriefing.com

Cluster LLM à 7 nœuds ESP32-S3 exécute un modèle de 0.4B

Hacker News •
×

Un moteur d'inférence de pipeline distribué exécutant un modèle de langue de 1,58 bits (Bit Net) sur plusieurs ESP32S3. Architecture : Ce projet exécute un modèle LLM de 0,5B découpé sur un cluster de 7 ESP32s3. Un agit en tant que maître et les autres sont des nœuds.

Le nœud maître exécute le tokenizer et l'embedding et les autres couches d'attention et MLP s'exécutent sur les nœuds. Le maître et les nœuds communiquent via une chaîne SPI haute vitesse. Le maître orchestre le traitement de l'entrée et la génération de la sortie finale.

Il exécute un tokenizer BPE et des embeddings de token INT4 (~14 Mo dans la Flash), transmettant les vecteurs d'état caché aux nœuds de calcul via le SPI CH A. Les nœuds de calcul gèrent les couches du transformeur avec quantification ternaire 1,58 bit pour les opérations d'attention et MLP, stockant les caches KV dans le PSRAM. Le pipeline s'écoule à travers 6 nœuds de calcul, chacun traitant 4 blocs de transformeur avec RMSNorm, RoPE et opérations MAC optimisées en assemblage.

Le dernier nœud renvoie les résultats au maître pour la normalisation finale et la projection de la tête LM. L'échantillonnage greedy produit l'ID de token suivant. Le projet inclut des outils complets : scripts Python pour la quantification, le packing du modèle et la sérialisation du tokenizer, plus le firmware ESP-IDF pour les cartes maîtres et nœuds.

La documentation couvre le flux de travail, les procédures de flash et le câblage hardware. Entités clés : Entreprises : GitHub, Hacker News.