HeadlinesBriefing favicon HeadlinesBriefing.com

Menembus Batas 1,58-bit untuk LLM Terner

Hacker News •
×

Model Bahasa Besar (LLM) terner menyimpan setiap bobot sebagai salah satu dari tiga simbol {-1,0,+1}, sehingga biaya model terner secara konvensional dirujuk ke log₂ 3 ≈ 1,585 bit per bobot dari teori informasi. Format penerapan yang berlaku mengemas lima bobot terner ke dalam satu byte (pengemasan lima trit), dan karena ukuran grup pangkat dua yang digunakan dalam praktik, ini dibulatkan menjadi 1,625 bit per bobot.

Lebar bit penyimpanan efektif ini memperlakukan ketiga simbol sebagai sama kemungkinan. Kami mengukur distribusi simbol aktual dari 29 model LLM terner dan menemukan bahwa nol mencapai hingga 51,5% dari semua bobot. Termotivasi oleh temuan ini, kami memperkenalkan BITCOS, tata letak adaptif distribusi sederhana yang terdiri dari bitmap kehadiran padat plus vektor tanda yang dipadatkan, dan berbiaya 2 - z bit per elemen bobot dengan kepadatan nol z pada bobot model.

BITCOS menyimpan bobot lebih kompak daripada pengemasan lima trit pada 26 dari 29 model yang diuji, dan mencapai 1,485 bit per bobot pada yang paling jarang di antaranya. BITCOS cocok untuk pembongkaran yang efisien pada prosesor modern dan GPU, dan kami menyajikan urutan pembongkaran yang dioptimalkan untuk AVX-512, AVX2, dan GPU Intel Xe2.

Diukur terhadap kernel perkalian matriks-vektor terner tercanggih produksi, pada kepadatan nol yang ditunjukkan model terner dunia nyata, keuntungan yang terwujud dengan tata letak yang kami usulkan mencapai 1,28×. Akhirnya, kami mengilustrasikan hasil inferensi LLM end-to-end pada 5 platform berbeda di mana throughput dekode meningkat hingga 1,18× pada CPU dan 1,27× pada GPU.

Entitas Kunci: Perusahaan: Intel | Orang: Evangelos Georganas