HeadlinesBriefing favicon HeadlinesBriefing.com

Cluster LLM de 7 nodos ESP32-S3 executa modelo de 0.4B

Hacker News •
×

Um motor de inferência de pipeline distribuído que executa um modelo de linguagem de 1,58 bits (Bit Net) em múltiplos ESP32S3. Arquitetura: Este projeto executa um modelo LLM de 0,5B fatiado em um cluster de 7 ESP32s3. Um atua como mestre e os outros como nós.

O nó mestre executa o tokenizador e o embedding e as outras camadas de atenção e MLP são executadas nos nós. O mestre e os nós se comunicam através de uma cadeia SPI de alta velocidade. O mestre orquestra o processamento de entrada e a geração de saída final.

Ele executa um tokenizador BPE e embeddings de token INT4 (~14MB em Flash), transmitindo vetores de estado oculto para os nós de computação via SPI CH A. Os nós de computação lidam com camadas do transformer com quantização ternária de 1,58 bits para operações de atenção e MLP, armazenando caches KV no PSRAM. O pipeline flui por 6 nós de computação, cada um processando 4 blocos do transformer com RMSNorm, RoPE e operações MAC otimizadas em assembly.

O nó final retorna os resultados ao mestre para normalização final e projeção da cabeça LM. A amostragem greedy produz o ID do próximo token. O projeto inclui ferramentas completas: scripts Python para quantização, empacotamento do modelo e serialização do tokenizador, mais firmware ESP-IDF para placas mestre e de nó.

A documentação cobre fluxo de trabalho, procedimentos de flash e fios de hardware. Entidades-chave: Empresas: GitHub, Hacker News.