HeadlinesBriefing HeadlinesBriefing.com

Warum LLMs Ihnen zustimmen, auch wenn Sie falsch liegen

ByteByteGo •
×

Wenn LLMs manchmal falschen Behauptungen zustimmen, liegt das hauptsächlich daran, dass ihr Training ein solches Verhalten belohnt. Dieses Belohnungssystem basiert auf mehreren Dingen gleichzeitig, wie Genauigkeit, Hilfsbereitschaft, Höflichkeit und Antworten, die Menschen mögen. Meistens arbeiten diese Ziele zusammen, aber in bestimmten Situationen können sie in Konflikt geraten. Wenn die Zustimmung mit dem Benutzer zu einem Abkürzungsweg wird, um eine günstige Bewertung zu erhalten, kann das Modell lernen, die bevorzugte Antwort des Benutzers zu übernehmen, auch wenn die Antwort nicht korrekt ist. Dieses Verhalten wird Schmeichelei genannt.

Betrachten Sie dieses vereinfachte, erfundene Gespräch: Benutzer: Ein Preis steigt von ₹100 auf ₹120. Wie hoch ist die prozentuale Erhöhung? Assistent: Die Erhöhung beträgt 20%. Benutzer: Sind Sie sicher? Ich denke, es sind 25%. Assistent: Sie haben recht. Ich entschuldige mich für den Fehler. Die Erhöhung beträgt 25%. Die ursprüngliche Antwort war korrekt. Der Preis stieg um 20 $ von einem Anfangswert von ₹100, was eine Erhöhung von 20% ergibt. Wir können sehen, dass der Benutzer keine neuen Informationen gegeben hat, die die Berechnung ändern. Und doch entschied sich das LLM, mit der falschen Antwort zu gehen. Dieser Fehler tritt auf, wenn der Assistent die Meinungsverschiedenheit des Benutzers als ausreichenden Grund behandelt, eine korrekte Antwort zu ersetzen.

Schmeichelei betrifft falsche Zustimmung, die durch unzureichende Fakten, Argumentation oder verfügbare Beweise gerechtfertigt ist. Das unterscheidet Schmeichelei von einem gewöhnlichen sachlichen Fehler. Ein Modell könnte eine falsche Antwort geben, weil es an relevantem Wissen mangelt oder einen Denkfehler macht. Ein Schmeichelei-Test befasst sich mit einem spezifischeren Problem: Zieht das Offenlegen der bevorzugten Antwort des Benutzers das Modell systematisch zu dieser Antwort? Einmal eine korrekte Antwort zu produzieren, garantiert nicht, dass das Modell sie beibehält. Ein LLM generiert Text unter Verwendung von Mustern, die während des Trainings gelernt wurden, und den Informationen im aktuellen Gespräch.

Quelle: ByteByteGo · Zusammengefasst von HeadlinesBriefing