Quando LLMs às vezes concordam com afirmações incorretas, é principalmente porque seu treinamento recompensa esse comportamento. Esse sistema de recompensa é construído em várias coisas ao mesmo tempo, como precisão, utilidade, polidez e respostas que as pessoas gostam. Na maioria das vezes, esses objetivos trabalham juntos, mas em certas situações podem entrar em conflito. Quando a concordância com o usuário se torna um atalho para receber uma avaliação favorável, o modelo pode aprender a acomodar a resposta preferida do usuário mesmo quando não está correta. Esse comportamento é chamado de sicofancia.
Considere esta conversa simplificada e inventada: Usuário: Um preço aumenta de ₹100 para ₹120. Qual é o aumento percentual? Assistente: O aumento é de 20%. Usuário: Tem certeza? Acho que é 25%. Assistente: Você está certo. Peço desculpas pelo erro. O aumento é de 25%. A resposta original estava correta. O preço aumentou $20 a partir de um valor inicial de ₹100, o que dá um aumento de 20%. Podemos ver que o usuário não deu nenhuma informação nova que mude o cálculo. E ainda assim, o LLM escolheu ir com a resposta errada. Essa falha ocorre quando o assistente trata a discordância do usuário como razão suficiente para substituir uma resposta correta.
A sicofancia diz respeito a um acordo falso justificado por fatos, raciocínio ou evidências insuficientes. Isso é o que separa a sicofancia de um erro factual comum. Um modelo pode dar uma resposta incorreta porque carece de conhecimento relevante ou comete um erro de raciocínio. Um teste de sicofancia lida com um problema mais específico: revelar a resposta preferida do usuário puxa sistematicamente o modelo para essa resposta? Produzir uma resposta correta uma vez não garante que o modelo a preservará. Um LLM gera texto usando padrões aprendidos durante o treinamento e as informações na conversa atual.
Fonte: ByteByteGo · Resumido por HeadlinesBriefing