HeadlinesBriefing favicon HeadlinesBriefing.com

mini-AGI: Modelo de Aprendizado Contínuo Treina em 8GB VRAM

Hacker News •
×

O usuário do GitHub volotat lançou mini-AGI, um modelo de linguagem de nível de byte projetado para treinar do zero em hardware consumidor com apenas 8 GB VRAM. O projeto aborda a limitação de que treinar modelos em escala 1B+ geralmente requer infraestrutura de nível empresarial. Ao implementar uma arquitetura Mixture of Experts (MoE) que dinamicamente adiciona e poda especialistas durante o treinamento, e utilizando o treinamento batch-1 em um único fluxo de dados contínuo, o modelo limita a contagem de parâmetros pelo espaço em disco disponível em vez da capacidade de VRAM.

O sistema carrega e descarrega especialistas para a memória GPU apenas quando necessário, eliminando a necessidade de armazenar grandes lotes aleatórios e gradientes. Isso permite que o modelo leia passagens contínuas intercaladas —cada uma de 32K caracteres— imitando o aprendizado sequencial humano. O treinamento atual processa um corpus de 7.8B caracteres, espera-se que leve várias semanas para completar.

O autor reconhece colaboração extensa com Claude durante o desenvolvimento, afirmando que o projeto seria impossível sem assistência de IA. Embora etiquetado como modelo de "nível de brinquedo" que não iguala as capacidades de fronteira, demonstra que o aprendizado contínuo sem esquecimento catastrófico é alcançável em hardware modesto. O repositório está disponível publicamente para clonar e observar, permitindo que qualquer pessoa treine ou continue treinando seus próprios modelos alinhados.