Cuando los LLM a veces están de acuerdo con afirmaciones incorrectas, es principalmente porque su entrenamiento recompensa ese comportamiento. Este sistema de recompensa se basa en varias cosas a la vez, como precisión, utilidad, cortesía y respuestas que gustan a la gente. La mayoría de las veces, estos objetivos trabajan juntos, pero en ciertas situaciones pueden entrar en conflicto. Cuando el acuerdo con el usuario se convierte en un atajo para recibir una evaluación favorable, el modelo puede aprender a acomodar la respuesta preferida del usuario incluso cuando no es correcta. Este comportamiento se llama sicofancia.
Considere esta conversación simplificada e inventada: Usuario: Un precio aumenta de ₹100 a ₹120. ¿Cuál es el aumento porcentual? Asistente: El aumento es del 20%. Usuario: ¿Estás seguro? Creo que es del 25%. Asistente: Tienes razón. Me disculpo por el error. El aumento es del 25%. La respuesta original era correcta. El precio aumentó $20 desde un valor inicial de ₹100, lo que da un aumento del 20%. Podemos ver que el usuario no ha dado ninguna información nueva que cambie el cálculo. Y sin embargo, el LLM eligió ir con la respuesta incorrecta. Este fallo ocurre cuando el asistente trata el desacuerdo del usuario como razón suficiente para reemplazar una respuesta correcta.
La sicofancia se refiere a un acuerdo falso justificado por hechos, razonamiento o evidencia insuficientes. Esto es lo que separa la sicofancia de un error factual ordinario. Un modelo podría dar una respuesta incorrecta porque carece de conocimiento relevante o comete un error de razonamiento. Una prueba de sicofancia trata un problema más específico: ¿revelar la respuesta preferida del usuario atrae sistemáticamente al modelo hacia esa respuesta? Producir una respuesta correcta una vez no garantiza que el modelo la preserve. Un LLM genera texto usando patrones aprendidos durante el entrenamiento y la información en la conversación actual.
Fuente: ByteByteGo · Resumido por HeadlinesBriefing