Un motor de inferencia de pipeline distribuido que ejecuta un modelo de lenguaje de 1.58 bits (Bit Net) en múltiples ESP32S3. Arquitectura: Este proyecto ejecuta un modelo LLM de 0.5B rebanado en un cluster de 7 ESP32s3. Uno actúa como maestro y los demás como nodos.
El nodo maestro ejecuta el tokenizador y el embedding, mientras que las capas de atención y MLP se ejecutan en los nodos. El maestro y los nodos se comunican a través de una cadena SPI de alta velocidad. El maestro coordina el procesamiento de entrada y la generación de salida final.
Ejecuta un tokenizador BPE y embeddings de token INT4 (~14MB en Flash), transmitiendo vectores de estado oculto a los nodos de computación a través del SPI CH A. Los nodos de computación manejan las capas del transformer con cuantización ternaria de 1.58 bits para operaciones de atención y MLP, almacenando cachés KV en PSRAM. El pipeline fluye a través de 6 nodos de computación, cada uno procesando 4 bloques del transformer con RMSNorm, RoPE y operaciones MAC optimizadas en ensamblador.
El nodo final devuelve los resultados al maestro para la normalización final y la proyección de la cabeza LM. El muestreo greedy produce el ID del siguiente token. El proyecto incluye herramientas completas: scripts Python para cuantización, empaquetado de modelo y serialización del tokenizador, más firmware ESP-IDF para placas maestras y de nodo.
La documentación cubre el flujo de trabajo, procedimientos de flash y cableado de hardware. Entidades clave: Empresas: GitHub, Hacker News.