HeadlinesBriefing favicon HeadlinesBriefing.com

Transformer Explainer: Model LLM Transformer Dijelaskan Secara Visual

Hacker News •
×

Transformer adalah arsitektur jaringan saraf yang secara fundamental mengubah Kecerdasan Buatan. Diperkenalkan dalam makalah 2017 "Attention is All You Need", ia menggerakkan model seperti GPT dari OpenAI, Llama dari Meta, dan Gemini dari Google, serta diterapkan dalam generasi audio, pengenalan gambar, prediksi struktur protein, dan bermain game. Transformer generatif teks memprediksi token berikutnya menggunakan self-attention, menangkap dependensi jarak jauh. Transformer Explainer didukung oleh GPT-2 (small) dengan 124 juta parameter, berbagi komponen arsitektural dengan model tercanggih.

Setiap Transformer generatif teks memiliki tiga komponen utama: Embedding mengubah token menjadi vektor numerik yang menangkap makna semantik; Transformer Block memproses dan mentransformasi data input dengan Mekanisme Attention (Attention Mechanism) (memungkinkan token berkomunikasi) dan MLP (menyempurnakan representasi setiap token); Output Probabilities mengubah embedding menjadi probabilitas token berikutnya.

Embedding mengubah prompt seperti "Data visualization empowers users to" menjadi representasi numerik. Langkah: 1) Tokenization memecah teks menjadi token (GPT-2 memiliki 50.257 token unik); 2) Token Embedding merepresentasikan setiap token sebagai vektor 768 dimensi; 3) Positional Encoding; 4) Final Embedding. Langkah-langkah ini memungkinkan model memproses dan menghasilkan teks.

Entitas Utama: Perusahaan: OpenAI, Meta, Google