Um artigo de 2023 de Berglund e colegas [1] argumenta que modelos de linguagem não obtêm recordação simétrica de fatos gratuitamente. Seu exemplo inicial: uma pessoa que aprende que Valentina Tereshkova foi a primeira mulher a viajar ao espaço também pode responder “Quem foi a primeira mulher a viajar ao espaço?” Isso parece trivial. Mas um modelo treinado na primeira frase, onde o nome vem antes da descrição, pode aprender a responder “Quem foi Valentina Tereshkova?” e ainda falhar quando a descrição vem primeiro. Os autores chamam isso de Maldição da Reversão.
Suas evidências vêm de dois lugares. Eles ajustaram GPT-3 e Llama-1 em fatos inventados e descobriram que a precisão era quase zero sempre que a pergunta vinha na ordem oposta às frases de treinamento. E testaram GPT-4 em celebridades reais: nomeou o pai de uma celebridade cerca de 79% das vezes, mas nomeou a celebridade quando recebeu o pai apenas cerca de 33% das vezes (o par clássico é “Quem é a mãe de Tom Cruise?” versus “Quem é o filho de Mary Lee Pfeiffer?”).
Os autores também apontam que a falha não é falta de lógica: se “A é B” está no prompt, GPT-4 pode inferir “B é A” perfeitamente. O problema aparece quando o fato foi aprendido durante o treinamento e precisa ser lembrado mais tarde do outro lado. É isso que o torna surpreendente, e é isso que o modelo de brinquedo abaixo nos permite ver diretamente.
Entidades-chave: Empresas: Towards Data Science | Pessoas: Berglund, Valentina Tereshkova, Tom Cruise, Mary Lee Pfeiffer
Pergunta frequente: O que é a Maldição da Reversão?
A Maldição da Reversão é um fenômeno onde um modelo de linguagem pode lembrar um fato na direção em que o aprendeu, mas falha quando perguntado ao contrário, embora as duas afirmações sejam logicamente simétricas.
Fonte: Towards Data Science · Resumido por HeadlinesBriefing