HeadlinesBriefing favicon HeadlinesBriefing.com

mini-AGI: Modelo de aprendizaje continuo entrena en 8GB VRAM

Hacker News •
×

El usuario de GitHub volotat ha lanzado mini-AGI, un modelo de lenguaje de nivel de byte de aprendizaje continuo diseñado para entrenar desde cero en hardware consumidor con solo 8 GB VRAM. El proyecto aborda la limitación de que entrenar modelos a escala de 1B+ parámetros típicamente requiere infraestructura de nivel empresarial. Al implementar una arquitectura Mixture of Experts (MoE) que dinámicamente agrega y poda expertos durante el entrenamiento, y utilizando el entrenamiento batch-1 en un solo flujo de datos continuo, el modelo limita el número de parámetros por el espacio en disco en lugar de la capacidad de VRAM.

El sistema carga y descarga expertos a la memoria de GPU solo cuando se necesitan, eliminando la necesidad de almacenar grandes lotes aleatorios y gradientes. Esto permite que el modelo lea pasajes continuos e intercambiados —cada uno de 32K caracteres— imitando el aprendizaje secuencial humano. El entrenamiento actual procesa un corpus de 7.8B caracteres, se espera que tarde varias semanas en completarse.

El autor reconoce una colaboración extensa con Claude durante el desarrollo, afirmando que el proyecto sería imposible sin la asistencia de IA. Aunque etiquetado como modelo de "nivel de juguete" que no iguala las capacidades de frontera, demuestra que el aprendizaje continuo sin olvido catastrófico es achievable en hardware modesto. El repositorio está disponible públicamente para clonar y observar, permitiendo a cualquier persona entrenar o continuar entrenando sus propios modelos alineados.