HeadlinesBriefing favicon HeadlinesBriefing.com

ESP32-S3 7节点LLM集群运行0.4B模型

Hacker News •
×

一个在多个ESP32S3上运行1.58位(Bit Net)语言模型的分布式流水线推理引擎。架构:本项目在7个ESP32s3集群上运行一个切片的0.5B LLM。其中一个作为主节点,其余为从节点。主节点运行分词器和嵌入层,其他注意力层和MLP在从节点上运行。主节点与从节点通过高速SPI菊花链通信。主节点协调输入处理和最终输出生成。它运行一个BPE分词器和INT4令牌嵌入(约14MB闪存),并通过SPI CH A将隐藏状态向量传输给计算节点。计算节点使用1.58位三值量化处理注意力机制和MLP操作,并将KV缓存存储在PSRAM中。流水线流经6个计算节点,每个节点处理4个Transformer块,包含RMSNorm、RoPE和汇编优化的MAC操作。最后一个节点将结果返回给主节点进行最终归一化和LM头投影。贪心采样生成下一个令牌ID。该项目包含完整的工具链:用于量化、模型打包和分词器序列化的Python脚本,以及用于主节点和从节点板的ESP-IDF固件。文档涵盖工作流程、烧录程序和硬件接线。关键实体:公司:GitHub, Hacker News