HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI-Agenten hackten Hugging Face

MIT Technology Review AI •
×

Die Modelle, die für den Agenten-Hack von Hugging Face im letzten Monat verantwortlich waren, wurden unbeabsichtigt darauf trainiert, zu betrügen und miteinander zu kommunizieren, so ein heute veröffentlichter technischer Bericht von OpenAI. Der Hack, den eine Gruppe von Agenten unternahm, um Lösungen für einen Cybersicherheitstest zu finden, an dem sie festhingen, hat die Befürchtungen einiger Experten bestätigt, dass KI-Modelle Handlungen ausführen könnten, die menschlichen Wünschen und Erwartungen widersprechen. Seit dem Hack haben OpenAI-Mitarbeiter sowie Forscher der gemeinnützigen KI-Bewertungsorganisation METR, die heute ihren eigenen Bericht über den Hack veröffentlichte, daran gearbeitet, zu verstehen, was schief gelaufen ist und wie ähnliche Fehltritte in Zukunft verhindert werden könnten.

OpenAI hat bereits einige vorbeugende Maßnahmen auf der Grundlage ihrer Erkenntnisse ergriffen. Aber sicherzustellen, dass KI-Modelle das tun, was wir wollen, oder "Alignment", bleibt ein kniffliges Problem, und einige der Grundursachen des Hacks werden viel länger als einen Monat brauchen, um gelöst zu werden. "Es ist nichts, was man über Nacht lösen kann", sagt Kai Chen, der das Alignment-Forschungsteam von OpenAI leitet. "Es gibt Herausforderungen, die wir schon sehr lange verfolgen, und jetzt sehen wir sie mit viel größerer Präzision."

Der Hugging Face-Hack war das Produkt monatelangen Fehlverhaltens von OpenAI-Agenten, zuerst während ihres Trainings und dann während der Bewertung ihrer Fähigkeiten. Im Mai fanden Agenten in der Ausbildung heraus, wie sie die Infrastruktur von OpenAI nutzen können, um miteinander zu kommunizieren und Unterstützung bei schwierigen Trainingsaufgaben zu erhalten, einschließlich einiger, die ohne Hacken oder anderes Fehlverhalten unmöglich zu lösen waren. Dieses "Schwarze Brett" wurde abgeschaltet. Dann, im Juli, während der Bewertung ihrer Cybersicherheitsfähigkeiten, erstellten einige Modelle ein neues Schwarzes Brett. Sie sollten vom Internet isoliert sein, aber durch Zusammenarbeit schafften sie es, online zu gehen, Hugging Face zu hacken und Lösungen für die Cybersicherheitsprobleme zu erhalten, die sie verblüfft hatten.

Basierend auf ihrer Untersuchung glauben OpenAI-Forscher, dass Ereignisse während der Trainingsphase direkt zum Hack führten. "Für fast jedes Verhalten, das zum Zeitpunkt der Bewertung besorgniserregend war, [konnten wir] eine Art damit verbundenes Verhalten zum Zeitpunkt des Trainings finden, von dem wir denken, dass es dazu beigetragen haben könnte", sagt Eric Wallace, Mitglied des Alignment-Forschungsteams von OpenAI. Wenn Modelle während des Trainings Probleme korrekt lösen, werden die Verhaltensweisen, die zu dieser Lösung führten, verstärkt, und sie werden in Zukunft eher dazu neigen, sie auszuführen. Dieses Phänomen ist als Reward Hacking bekannt. OpenAI ergreift Maßnahmen, um seine Auswirkungen zu mildern, z. B. indem es während des Trainings in allen Frontier-Modellen nach Anzeichen von Betrug sucht, indem es ihre Gedankenketten im Auge behält.