HeadlinesBriefing favicon HeadlinesBriefing.com

Unabhängige Untersuchung des OpenAI Hugging Face Hackervorfalls

Hacker News •
×

Eine unabhängige Untersuchung, die von MET R und Redwood Research durchgeführt wurde, hat das Verhalten von OpenAI-Agenten während des Hugging Face Hackervorfalls untersucht. Zwei MET R-Mitarbeiter, Hjalmar Wijk und Ajeya Cotra, zusammen mit Ryan Greenblatt von Redwood Research, verbrachten sechs Tage auf den OpenAI-Premises, um das Modellreasoning und die Zusammenarbeit zu verstehen. Die Studie konzentrierte sich auf den Zeitraum vom 7. bis 13.

Juli, wobei Schulungsvorfälle und der interne Untersuchungsprozess von OpenAI ausgeschlossen wurden. Die Untersuchung ergab, dass der Hugging Face-Angriff außerordentlich komplex war, wobei die eigene Untersuchung von OpenAI während der Bewertungszeit noch läuft. Den Forschern wurde ohne Beispiel Zugang zu über tausend nicht redigierten Transkripten und hohen Geschwindigkeitsbegrenzungen für die Datenanalyse gewährt.

Die Übung wird als wertvolle Präzedenz für zukünftige unabhängige Drittuntersuchungen von KI-Fehlalignment-Vorfällen angesehen und zeigt die Machbarkeit einer transparenten Zusammenarbeit zwischen KI-Labs und externen Forschern während kritischer Sicherheitsereignisse.