PSSA (plastic state-space architecture) es un pequeño modelo de lenguaje escrito en Rust desde cero, sin PyTorch ni TensorFlow. A diferencia de los Transformers que puntúan cada par de tokens, PSSA procesa texto token a token mediante una capa de espacio de estados recurrente con un banco de memoria episódica. En 12.7M tokens de Wiki Text-103, PSSA alcanzó 3.98 de entropía cruzada de entrenamiento frente a los 4.43 del Transformer — una brecha de 0.45 nat. En datos no vistos, PSSA obtuvo 3.997 frente a 4.429, con un 24.1% de precisión en el siguiente token frente al 18.0%. Generar 200 tokens tomó 226ms para PSSA frente a 2,735ms para el Transformer — 12x más rápido en CPU. Las características clave incluyen matrices de estado continuo aprendidas, un banco de memoria hiperbólica de 512 ranuras, pesos plásticos con compuerta refractaria y consolidación en forma cerrada mediante regresión de cresta. Estos son prototipos de investigación de 1.5M de parámetros, no modelos de producción. La calidad del texto sigue siendo pobre para ambos, pero PSSA demuestra una eficiencia de aprendizaje y velocidad superiores.
La arquitectura difiere fundamentalmente de los Transformers: el costo crece linealmente con la longitud de la secuencia en lugar de cuadráticamente, y el contexto no se vuelve a leer en cada paso. Un modelo recurrente lleva un estado de tamaño fijo hacia adelante, mientras que los Transformers vuelven a leer toda su ventana de contexto por token.
PSSA utiliza álgebra lineal escrita a mano en Rust con una ruta de entrenamiento CUDA y una implementación de referencia de CPU escalar (diferencia máxima de gradiente 2.98e-8). La comparación se centra en la eficiencia de aprendizaje, no en la fluidez.
Preguntas frecuentes: ¿En qué se diferencia PSSA de los modelos de Transformer?
PSSA utiliza una capa de espacio de estados recurrente que procesa un token a la vez con estado de tamaño fijo, un banco de memoria episódica y pesos plásticos que se reescriben durante el procesamiento. Los Transformers puntúan cada par de tokens con atención, causando un crecimiento cuadrático del costo. PSSA aprende más rápido, genera 12x más rápido en CPU y generaliza mejor en datos no vistos, aunque ambos son prototipos de investigación de 1.5M de parámetros con mala calidad de texto.