HeadlinesBriefing favicon HeadlinesBriefing.com

PSSA : Le modèle d'IA en Rust bat les Transformers

Hacker News •
×

PSSA (architecture espace d'état plastique) est un petit modèle de langage écrit en Rust depuis zéro, sans PyTorch ni TensorFlow. Contrairement aux transformateurs qui notent chaque paire de tokens, PSSA traite le texte token par token via une couche d'espace d'état récurrent avec une banque de mémoire épisodique. Sur 12,7M de tokens de Wiki Text-103, PSSA a atteint 3,98 d'entropie croisée d'entraînement contre 4,43 pour le transformateur — un écart de 0,45 nat. Sur des données inédites, PSSA a obtenu 3,997 contre 4,429, avec une précision du prochain token de 24,1 % contre 18,0 %. La génération de 200 tokens a pris 226 ms pour PSSA contre 2 735 ms pour le transformateur — 12 fois plus rapide sur CPU. Les caractéristiques clés incluent des matrices d'état continu apprises, une banque de mémoire hyperbolique de 512 emplacements, des poids plastiques avec gating réfractaire, et une consolidation en forme fermée via la régression ridge Ce sont des prototypes de recherche de 1,5 M de paramètres, pas des modèles de production. La qualité du texte reste mauvaise pour les deux, mais PSSA démontre une efficacité d'apprentissage et une vitesse supérieures.

L'architecture diffère fondamentalement des transformateurs : le coût augmente linéairement avec la longueur de la séquence au lieu de manière quadratique, et le contexte n'est pas relu à chaque étape. Un modèle récurrent transporte un état de taille fixe vers l'avant, tandis que les transformateurs relisent leur fenêtre de contexte entière par token.

PSSA utilise de l'algèbre linéaire écrite à la main en Rust avec un chemin d'entraînement CUDA et une implémentation de référence CPU scalaire (différence maximale de gradient 2,98e-8). La comparaison porte sur l'efficacité d'apprentissage, pas sur la fluidité.

FAQ : En quoi PSSA diffère-t-il des modèles de transformateurs ?

PSSA utilise une couche d'espace d'état récurrent qui traite un token à la fois avec un état de taille fixe, une banque de mémoire épisodique, et des poids plastiques qui sont réécrits pendant le traitement. Les transformateurs notent chaque paire de tokens avec l'attention, provoquant une croissance quadratique du coût. PSSA apprend plus rapidement, génère 12 fois plus vite sur CPU, et généralise mieux sur des données inédites, bien que les deux soient des prototypes de recherche de 1,5 M de paramètres avec une mauvaise qualité de texte.