HeadlinesBriefing favicon HeadlinesBriefing.com

mini-AGI: Model Pembelajaran Berkelanjutan Melatih pada 8GB VRAM

Hacker News •
×

Pengguna GitHub volotat merilis mini-AGI, model bahasa level byte yang dirancang untuk dilatih dari nol pada hardware konsumen dengan hanya 8 GB VRAM. Proyek ini menyelesaikan batasan bahwa pelatihan model skala 1B+ umumnya memerlukan infrastruktur tingkat perusahaan. Dengan mengimplementasikan arsitektur Mixture of Experts (MoE) yang secara dinamis menambah dan memotong pakar selama pelatihan, dan menggunakan batch-1 training pada satu aliran data terus-menerus, model batas parameter oleh ruang disk yang tersedia rather than VRAM kapasitas.

Sistem memuat dan memunload pakar ke memori GPU hanya ketika perlu, menghilangkan kebutuhan untuk menyimpan besar batch acak dan gradient. Ini memungkinkan model untuk membaca pasangan lintas terus-menerus—setiap 32K karakter— mensimpan pembelajaran urutan manusia. Training saat ini memproses corpus 7.8B karakter, diharapkan memakan beberapa minggu untuk selesai.

Penulis mengakui kolaborasi menyeluruh dengan Claude selama pengembangan, menyatakan proyek ini tanpa bantuan AI mustimpossible. Meskipun labeled sebagai "model level mainan" yang tidak sesuai dengan kemampuan frontier, ia menunjukkan bahwa pembelajaran berkelanjutan tanpa catastrophic forgetting pada hardware sederhana dapat dicapai. Repository secara publik untuk cloning dan observasi tersedia, memungkinkan siapa saja untuk melatih atau melanjutkan melatih model terlini mereka.