Un artículo de 2023 de Berglund y colegas [1] argumenta que los modelos de lenguaje no obtienen recuerdo simétrico de hechos de forma gratuita. Su ejemplo inicial: una persona que aprende que Valentina Tereshkova fue la primera mujer en viajar al espacio también puede responder “¿Quién fue la primera mujer en viajar al espacio?” Eso parece trivial. Pero un modelo entrenado en la primera oración, donde el nombre precede a la descripción, puede aprender a responder “¿Quién fue Valentina Tereshkova?” y aún fallar cuando la descripción viene primero. Los autores llaman a esto la Maldición de la Inversión.
Su evidencia proviene de dos lugares. Afinaron GPT-3 y Llama-1 en hechos inventados y encontraron que la precisión era casi cero cada vez que la pregunta venía en el orden opuesto a las oraciones de entrenamiento. Y probaron GPT-4 en celebridades reales: nombró al padre de una celebridad aproximadamente el 79% de las veces, pero nombró a la celebridad cuando se le daba el padre solo aproximadamente el 33% de las veces (el par clásico es “¿Quién es la madre de Tom Cruise?” versus “¿Quién es el hijo de Mary Lee Pfeiffer?”).
Los autores también señalan que el fracaso no es falta de lógica: si “A es B” está en el prompt, GPT-4 puede inferir “B es A” perfectamente. El problema aparece cuando el hecho fue aprendido durante el entrenamiento y luego debe ser recordado desde el otro lado. Eso es lo que lo hace sorprendente, y es lo que el modelo de juguete a continuación nos permite observar directamente.
Entidades clave: Empresas: Towards Data Science | Personas: Berglund, Valentina Tereshkova, Tom Cruise, Mary Lee Pfeiffer
Pregunta frecuente: ¿Qué es la Maldición de la Inversión?
La Maldición de la Inversión es un fenómeno donde un modelo de lenguaje puede recordar un hecho en la dirección en que lo aprendió pero falla cuando se le pregunta al revés, aunque las dos afirmaciones sean lógicamente simétricas.
Fuente: Towards Data Science · Resumido por HeadlinesBriefing