HeadlinesBriefing favicon HeadlinesBriefing.com

/runes/llm-cluster-0.4b-on-esp32-s3-7-nodes

Hacker News •
×

محرك استنتاج توزيعي ل-running نموذج لغة بحجم 0.4B على 7 أجهزة ESP32-S3. الهيكلية: هذا_proj ي-running نموذج LLM مجزأ حجم 0.5B على ع cluster من 7 أجهزة ESP32s3. One act as master والآخرون كノード. Master ي-running tokenizer و embeding والآخرون attention layer و MLP على النodes.

Master والノodes ياتصال من خلال high speed SPI Daisy-Chain. Master ي orchestrate معالجة المدخلات وتوليد المخرجات النهائية. He runs a BPE tokenizer و INT4 token embeddings (~14MB في Flash)، transmitting hidden state vectors إلى compute nodes عبر SPI CH A.

Compute nodes ت handle transformer layers مع 1.58-bit ternary quantization للattention و MLP operations، storing KV caches في PSRAM. Pipeline يتدفق من خلال 6 compute nodes، كل one يhandle 4 transformer blocks مع RMSNorm، RoPE، و assembly-optimized MAC operations. العقدة النهائية تُعيد النتائج إلى Master للnormalization النهائية و LM head projection. Greedy sampling ينتج token ID التالي. whitening tool: Python scripts للquantization، model packing، و tokenizer serialization، plus ESP-IDF firmware للمaster و node boards.

Documentation تغطية workflow، flashing procedures، و hardware wiring.