HeadlinesBriefing favicon HeadlinesBriefing.com

mini-AGI : Modèle d'apprentissage continu entraîné sur 8 Go VRAM

Hacker News •
×

L'utilisateur GitHub volotat a publié mini-AGI, un modèle de langage de niveau byte conçu pour entraîner depuis zéro sur du matériel consommateur avec seulement 8 Go VRAM. Le projet traite la limitation selon laquelle entraîner des modèles à échelle 1B+ nécessite généralement une infrastructure de niveau entreprise. En mettant en œuvre une architecture Mixture of Experts (MoE) qui ajoute et élimine dynamiquement des experts pendant l'entraînement, et en utilisant un entraînement batch-1 sur un flux de données continu, le modèle borne le nombre de paramètres par l'espace disque disponible plutôt que la capacité VRAM.

Le système charge et décharge les experts vers la mémoire GPU uniquement lorsqu'ils sont nécessaires, éliminant le besoin de stocker de grands lots aléatoires et des gradients. Cela permet au modèle de lire des passages continus intercalés —chaque 32K caractères— imitant l'apprentissage séquentiel humain. L'entraînement actuel traite un corpus de 7.8B caractères, on s'attend à ce qu'il prenne plusieurs semaines pour terminer.

L'auteur reconnaît une collaboration extensive avec Claude pendant le développement, affirmant que le projet serait impossible sans assistance IA. Bien qu'étiqueté comme modèle de « niveau jouet » ne correspondant pas aux capacités de pointe, il démontre que l'apprentissage continu sans oubli catastrophique est réalisable sur du matériel modeste. Le dépôt est disponible publiquement pour cloner et observer, permettant à quiconque d'entraîner ou de continuer à entraîner ses propres modèles alignés.