Mesin inferensi pipeline terdistribusi yang menjalankan model bahasa 1.58 bit (Bit Net) pada multiple ESP32S3. Arsitektur: Proyek ini menjalankan model LLM 0.5B yang diiris pada cluster dari 7 ESP32s3. Satu bertindak sebagai master dan lainnya adalah node.
Node master menjalankan tokenizer dan embeding dan layer attention lain dan MLP dijalankan pada node. Master dan node berkomunikasi melalui high speed SPI Daisy-Chain. Master mengoordinasikan pemrosesan masukan dan generate keluaran akhir.
Ia menjalankan BPE tokenizer dan INT4 token embeddings (~14MB di Flash), mengirimkan vektor state tersembunyi ke node komputasi melalui SPI CH A. Node komputasi menangani layer transformer dengan 1.58-bit ternary quantization untuk operasi attention dan MLP, menyimpan KV cache di PSRAM. Pipeline mengalir melalui 6 node komputasi, masing-masing memproses 4 transformer block dengan RMSNorm, RoPE, dan operasi MAC yang dioptimalkan assembly.
Node terakhir mengembalikan hasil ke master untuk normalisasi akhir dan proyeksi LM head. Greedy sampling menghasilkan ID token berikutnya. Proyek ini mencakup tooling komprehensif: Python scripts untuk quantization, model packing, dan tokenizer serialization, plus firmware ESP-IDF untuk master dan node board.
Dokumentasi mencakup workflow, flashing procedures, dan hardware wiring. Entitas kunci: Perusahaan: GitHub, Hacker News.