HeadlinesBriefing favicon HeadlinesBriefing.com

mini-AGI: Kontinuierliches Lernmodell trainiert mit 8GB VRAM

Hacker News •
×

GitHub-Nutzer volotat hat mini-AGI veröffentlicht, einen byte-level Sprachmodell für kontinuierliches Lernen, das darauf ausgelegt ist, von Grund auf mit nur 8 GB VRAM auf Consumer-Hardware zu trainieren. Das Projekt geht auf die Einschränkung ein, dass das Trainieren von Modellen mit 1B+ Parametern typischerweise Enterprise-Infrastruktur erfordert. Durch die Implementierung einer Mixture of Experts (MoE) Architektur, die während des Trainings dynam Experten hinzufügt und entfernt, und Nutzung von batch-1 Training auf einem einzigen kontinuierlichen Datenstrom, bindet das Modell die Parameteranzahl an verfügbaren Diskplatz statt VRAM-Kapazität.

Das System lädt und entlädt Experten nur dann in die GPU-Speicher, wenn sie benötigt werden, und eliminiert den Bedarf, große zufällige Batches und Gradienten zu speichern. Dies ermöglicht es dem Modell, kontinuierliche interleaved Passagen — jede 32K Zeichen lang — zu lesen, was menschliches sequenzielles Lernen nachahmt. Der aktuelle Trainingslauf verarbeitet einen 7.8B Zeichen großen Korpus, der mehrere Wochen zur Fertigstellung benötigt.

Der Autor erkennt umfangreiche Zusammenarbeit mit Claude während der Entwicklung an und sagt, das Projekt wäre ohne KI-Unterstützung unmöglich. Obwohl es als „Toy-Level-Modell“ bezeichnet wird, das Frontier-Fähigkeiten nicht erreicht, demonstriert es, dass kontinuierliches Lernen ohne katastrophales Vergessen auf bescheidener Hardware möglich ist. Das Repository ist öffentlich zum Klonen und Beobachten verfügbar, sodass jeder sein eigenes Modell trainieren oder weitertrainieren kann.