HeadlinesBriefing favicon HeadlinesBriefing.com

ESP32-S3 7ノードLLMクラスター0.4Bモデルを実行

Hacker News •
×

複数のESP32S3で1.58ビット(Bit Net)言語モデルを実行する分散パイプライン推論エンジン。アーキテクチャ: このプロジェクトは7つのESP32s3のクラスターで0.5B LLMのスライスを実行します。1つがマスターとして機能し、他はノードです。マスターノードは tokenizer と embeding を実行し、他の attention 層と MLP はノードで実行されます。マスターとノードは高速SPIデジーチェーンで通信します。マスターは入力処理と最終出力生成をオーケストレートします。BPE tokenizer とINT4 token embeddings(Flash内約14MB)を実行し、SPI CH A経由で隠れ状態ベクトルを計算ノードに送信します。計算ノードは1.58ビット三値量子化を使用してattentionとMLP操作用のトランスフォーマー層を処理し、KVキャッシュをPSRAMに格納します。パイプラインは6つの計算ノードを経由し、各ノードはRMSNorm、RoPE、アセンブリ最適化MAC操作付きで4つのトランスフォーマーブロックを処理します。最終ノードは結果をマスターに返し、最終正規化とLMヘッド投影を行います。Greedy samplingが次のトークンIDを生成します。プロジェクト包括的ツール: 量子化、モデルパッキング、tokenizerシリアライズ用Pythonスクリプト、マスターとノードボード用ESP-IDFファームウェア。ドキュメントはワークフロー、フラッシュ手順、hardware配線をカバー。主要エンティティ: 会社: GitHub, Hacker News