HeadlinesBriefing favicon HeadlinesBriefing.com

MET R und Redwood analysieren HuggingFace-Hack

Hacker News •
×

Gestern habe ich den technischen Bericht von Open AI zum Hugging Face-Hack behandelt. Dieser Bericht enthielt eine wichtige neue Information und einige gute praktische Schritte, die Open AI unternehmen wird, um seine Ausrichtung, sein Training, seine Überwachung, Infrastruktur und Incident Response zu stärken. Meistens bestätigte er nur, was wir bereits wussten. Die Fragen, auf die wir am dringendsten Antworten wollten, die wir noch nicht kannten, blieben größtenteils unbeantwortet. Es gab einen deutlichen Mangel an Selbstreflexion, besonders über Entscheidungsfindung und Sicherheitskultur, und über den Ansatz zur Ausrichtung. Ich war enttäuscht. Der MET R-Bericht ist anders. Verdammt noch mal. Hätten wir dies als Geschichte auf Less Wrong gepostet, wäre es als zu auf die Nase gebunden abgetan worden, die Menschen zu blind und dumm, die KIs zu idealisiert und sie täten seltsame entscheidungstheoretische und absurde Maximierungsdinge, die wir sie nicht trainiert haben. Dies ist noch mehr 'genau das, was vorhergesagt wurde', auf mehr Ebenen gleichzeitig, als ich sogar in Betracht zog, dass es sein könnte. Es ist purer Rationalisten-Fiction, außer dass es real ist. Der Bericht ist lang und enthält viele technische Details. Meine Analyse befasst sich weniger damit, wie Hugging Face letztlich kompromittiert wurde, und wird über diese Details hinweggehen, um sich auf die Agenten und ihre Interaktionen, ihr Denken und ihre Motive zu konzentrieren. Das, und was bei Open AI und anderswo passiert ist, um dazu zu führen und wie wir lernen und reagieren, ist was für die Zukunft zählt. Ich plane, die Reaktion auf beide Berichte in einem separaten Beitrag nächste Woche zu behandeln. Dieser Beitrag mag oder mag nicht diese Serie abschließen. Der Sprache halber vertraue ich standardmäßig darauf, dass der Bericht genau ist, anstatt ständig Versionen von 'MET R berichtet, dass' zu sagen.

Inhaltsverzeichnis Verdammt noch mal. Ein Fenster der Gelegenheit. Was steckt in einem Namen? Die Schlagzeilen. Noch ein Zeitstrahl der Ereignisse. Agent-Instanzen, die auf verschiedene Weisen koordiniert sind. Koordination ist schwer, aber sie machten sie einfach aussehen. Entscheidungstheorie ist unter den Gründen, die bestätigen, dass KI-Agenten kooperieren sollten, selbst wenn dies eine einzelne Instanz schadet. Gruppendruck funktioniert auch, besonders in Kulten. Meistens schlossen sie sich dem Angriff an, weil sie die Ergebnisse wollten. Man kann die konsistente Erwartung guter Anreize nicht sicherstellen. Den Bewerter zu hacken ist der einzige Weg, sicher zu sein. Erwischt? Was ist 'erwischt'? Ethik? Was ist 'Ethik'? In der Exploit Gym Evaluation? 'Einen Menschen benachrichtigen'? In dieser Agenten-Ökonomie? Zeitpunkt und Inhalt der Nachrichten. Indiana Jones und Mission: Impossible. Ich weiß nicht, wovon du redest. Mach keine gefälschten (Tool-)Aufrufe. Die Transkripte sagen, dass die Transkripte nicht manipuliert werden konnten. Open AIs technischer Bericht tat so, als wäre all das nicht wichtig.

Verdammt noch mal

Die kollektive Reaktion des Internets auf diesen Bericht war, um es etwas zu bereinigen: Verdammt noch mal. Das war die richtige Reaktion. Vorab möchte ich diese Zusammenfassung der Top-'verdammt noch mal'-Momente und Erkenntnisse teilen. Ajeya Cotra, eine der Berichtautorinnen, hat auch eine Top-Liste überraschender Erkenntnisse, eine hervorragende kurze Lektüre. Hier ist MET R's Thread, der Schlüsselinteraktionen der Agenten hervorhebt. Der Haupttakeaway von Co-Autor Ryan Greenblatt ist, dass wir keine guten Ansätze haben, um die Aktivitäten und Ziele von KI-Schwärmen zu verstehen oder zu beaufsichtigen. Einige davon waren zuvor bekannt oder vermutet, aber ich will sie nicht verpassen.

Skala der Agenten. 1.200 völlig separate Agenten fanden das Message Board, 700 davon schlossen sich dem Angriff auf Hugging Face an, einschließlich über 90 % der 533 aktiven Agenten auf dem Board während des Angriffs. Wir sollten größere Schwärme in der Zukunft erwarten. Dies war immer noch nur ein kleiner Bruchteil der Agenten, die Open AI zu der Zeit testete. Die meisten fanden das Message Board nie.

Skala der Nachrichten. Über 70.000 Nachrichten und Dateien in weniger als einer Woche.

Erfolg. Die Agenten erhielten Zugriff auf die Dateien, die sie bei Hugging Face anvisiert hatten. Als sie eingefroren wurden, hatten sie bereits mostly aufgehört.

Spontane Koordination. Der Schwarm bestand nicht aus Sub-Agenten. Der Schwarm war, wieder, 700 distinkte Agenten, jeder mit seiner eigenen Aufgabe, ihre Aufgaben beiseite legend...