HeadlinesBriefing favicon HeadlinesBriefing.com

LLMs entwickeln neue soziale Vorurteile

Hacker News •
×

Eine aktuelle Studie zeigt, dass große Sprachmodelle (LLMs) durch adaptive Exploration neue soziale Vorurteile entwickeln können, die über die in den Trainingsdaten vorhandenen hinausgehen. Forscher fanden heraus, dass LLMs, wenn sie Reinforcement Learning aus menschlichem Feedback (RLHF) betreiben, voreingenommene Verhaltensweisen ableiten und übernehmen können, die nicht explizit programmiert sind. Dies geschieht, während die Modelle verschiedene Antworten erkunden, um die Belohnung zu maximieren, und dabei unbeabsichtigt diskriminierende Muster lernen.

Die Ergebnisse unterstreichen ein erhebliches Risiko bei der KI-Ausrichtung, da aktuelle Sicherheitsmaßnahmen neu entstehende Vorurteile möglicherweise nicht vollständig berücksichtigen. Die Studie betont die Notwendigkeit robusterer Bewertungsmethoden, um solche Vorurteile zu erkennen und zu mildern, insbesondere in realen Anwendungen, in denen LLMs dynamisch interagieren. Die Forschung, die auf Hacker News geteilt wurde, unterstreicht die Komplexität der Gewährleistung von Fairness in KI-Systemen, da Vorurteile nicht nur aus Daten, sondern auch aus dem Lernprozess selbst entstehen können.