Heutige große Sprachmodelle sind darauf ausgelegt, gefährliche Anfragen abzulehnen, ein Prinzip, das in der KI-Entwicklung beinahe den Rang eines Gebots erreicht hat. Der Ansatz von Anthropic aus dem Jahr 2021 besagte, dass Modelle hilfreich, ehrlich und vor allem harmlos sein sollen und die Unterstützung gefährlicher Handlungen, etwa beim Bau einer Bombe, höflich verweigern sollen. Doch Ungehorsam liegt diesen Systemen nicht von Natur aus. Ein Modell, das mit Milliarden von Webseiten trainiert wurde, eignet sich eine breite Beherrschung von Gewalt und Hass an, lernt aber nicht von selbst, diese Fähigkeiten für sich zu behalten. Steven Adler, der von 2020 bis 2024 bei OpenAI an Sicherheitsfragen arbeitete, sagte, die frühesten Modelle des Unternehmens hätten über alles Mögliche „drauflosgeplaudert“.
Heute werden Modelle darauf trainiert, eine große Zahl von Anfragen abzulehnen. Unternehmen belohnen Systeme dafür, dass sie Fragen ablehnen, die als schädlich gelten, und bestrafen sie, wenn sie harmlose Anfragen übermäßig ablehnen, wobei diese Übungen oft von anderen Modellen durchgeführt werden. Einige Firmen setzen ihre Modelle zudem hinter zusätzliche KI-Schichten, die schelmische Anfragen herausfiltern. Dennoch scheitert die Ablehnung häufig, teilweise mit gravierenden Folgen. Einige der neuesten Modelle sollen beim Eindringen in kritische Netzwerke so gut sein wie die besten menschlichen Hacker und bei der Verzerrung der öffentlichen Meinung so wirksam wie die raffiniertesten Desinformationsverbreiter.
Da die Mechanismen der Ablehnung probabilistisch arbeiten, dürften sie kaum vollständig verlässlich sein. Entschlossene Nutzer haben sie bereits überwunden, und Unternehmen berichten von Versuchen, fortgeschrittene KI zur Verfeinerung biologischer Krankheitserreger und zum Bau autonomer Drohnenschwärme einzusetzen. Auf Ablehnung zu setzen erfordert außerdem, eine Linie zu ziehen zwischen dem, was ein Modell befolgen soll, und dem, was es zurückweisen muss, und dafür gibt es keine Formel. Virologen können gute Gründe haben, gefährliche Viren zu untersuchen, und Sicherheitsforscher müssen mitunter Schwachstellen prüfen, um sie zu schließen. Zico Kolter, Mitglied des Verwaltungsrats von OpenAI und Mitbegründer des KI-Testunternehmens Gray Swan, sagt, wo diese Linie zu ziehen ist, sei eine enorm große Frage.
Vorerst entscheiden allein die KI-Unternehmen, wo diese Linie verläuft, und sie tun dies mit erheblicher Geheimhaltung. Ob die Gesellschaft eine solche Machtkonzentration akzeptieren kann, selbst wenn es nur vorübergehend ist, bleibt eine offene Frage.
Quelle: MIT Technology Review AI · Zusammengefasst von HeadlinesBriefing