HeadlinesBriefing favicon HeadlinesBriefing.com

Кластер LLM из 7 узлов ESP32-S3 запускает модель 0.4B

Hacker News •
×

Распределенный конвейерный движок вывода, запускающий языковую модель 1.58 бит (Bit Net) на нескольких ESP32S3. Архитектура: Этот проект запускает срезанную модель LLM размером 0.5B на кластере из 7 ESP32s3. Один выступает в роли мастера, остальные — узлы. Мастер-узел запускает токенизатор и embedding, а остальные слои внимания и MLP работают на узлах. Мастер и узлы общаются через высокоскоростную SPI-цепочку. Мастер координирует обработку входных данных и генерацию конечного выхода. Он запускает BPE-токенизатор и INT4-вложения токенов (~14 МБ во Flash), передавая векторы скрытого состояния вычислительным узлам через SPI CH A. Вычислительные узлы обрабатывают слои трансформера с 1.58-битной тернарной квантовацией для операций внимания и MLP, сохраняя кэши KV в PSRAM. Конвейер проходит через 6 вычислительных узлов, каждый из которых обрабатывает 4 блока трансформера с RMSNorm, RoPE и ассемблерно-оптимизированными операциями MAC. Последний узел возвращает результаты мастеру для окончательной нормализации и проекции LM-головки. Жадный sampling генерирует ID следующего токена. Проект включает в себя полный инструментарий: Python-скрипты для квантования, упаковки модели и сериализации токенизатора, а также прошивку ESP-IDF для мастер- и узловых плат. Документация охватывает рабочий процесс, flashing-процедуры и аппаратную проводку. Ключевые сущности: Компании: GitHub, Hacker News