HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAIs Prinzipien für Drittbewertungen

OpenAI Blog •
×

Frontier-KI-Labore tragen eine immense Verantwortung für das sichere Training, die Bewertung und den Einsatz von Modellen. Bewertungen durch Dritte sind ein kritischer Teil, um diese Verantwortung auszugleichen, Möglichkeiten für Beiträge zur KI-Sicherheit zu erweitern, die Welt informiert zu halten und Labore für klare und unabhängig unterstützte Sicherheitsaussagen zur Rechenschaft zu ziehen. Als Teil unserer Bemühungen, mit der Frontier Schritt zu halten, verpflichtet sich OpenAI, unabhängige Bewertungen mit tiefen Zugriffsebenen über Training, Evaluierung und Bereitstellung hinweg zu unterstützen. Dieser Zugang sollte es Bewertern ermöglichen, unsere Annahmen herauszufordern, Risiken zu identifizieren, die wir möglicherweise übersehen haben, und ihre eigenen Schlussfolgerungen über die Wirksamkeit unserer Schutzmaßnahmen zu ziehen.

Wir arbeiten seit langem mit Bewertern Dritter in verschiedenen Phasen des Modellentwicklungs- und Bereitstellungsprozesses zusammen. Wir haben auch Bewertungen durch Dritte in unsere Preparedness-Framework-Praktiken integriert und Organisationen und Gesetze unterstützt, die sich für einen strengeren und rechenschaftspflichtigeren Prozess einsetzen. Während dieser Engagements haben wir tiefe Formen des Zugangs bereitgestellt, darunter Informationen über unsere technischen Schutzmaßnahmen, sichtbaren Zugang zur Gedankenkette und beispiellose Ebenen vertraulicher Daten und internen Bereitstellungszugang für Incident Response und Monitoring-Red-Teaming. Die hier geteilten Prioritäten und Prinzipien konzentrieren sich auf unsere Zusammenarbeit mit unabhängigen Bewertungsorganisationen im privaten und gemeinnützigen Sektor zu technischen Sicherheitsbewertungen. Sie ergänzen unsere Arbeit mit Regierungen zu Tests und Evaluierung, wo unterschiedliche Rollen und Verantwortlichkeiten unterschiedliche Ansätze erfordern können.

Um diese Bewertungen effektiv zu machen, sind starke Unabhängigkeitsmechanismen, wissenschaftliche Strenge, robuste Sicherheitspraktiken und klare Verantwortlichkeiten erforderlich. Labore haben die Verantwortung, eine sinnvolle Prüfung zu ermöglichen und gleichzeitig sensible Informationen zu schützen. Labore und unabhängige Bewerter teilen die Verantwortung, dies richtig zu machen, und sollten mit gemeinsamen internationalen Standards für Sicherheits- und Schutzpraktiken arbeiten. Im Folgenden schlagen wir vier Prioritätsbereiche für eine tiefere Bewertung vor, zusammen mit Prinzipien für strenge, sichere und unabhängige Arbeit.

Prioritätsbereiche für die Bewertung: Bewertungen durch Dritte sind am nützlichsten, wenn sie spezifische, folgenreiche Fragen behandeln: Stützen die Beweise den Sicherheitsfall und die Sicherheitsaussagen eines Labors? Testen die Evaluierungen die Risiken, die sie messen sollen, angemessen? Funktionieren die Schutzmaßnahmen unter realistischen Bedingungen? Die hier beschriebenen Bewertungen sollen je nach den untersuchten Sicherheitsfragen unterschiedliche Formen annehmen. Wir erwarten, mehrere Bewertungen parallel und über verschiedene Zeiträume zu unterstützen, einige dauern Wochen und andere mehrere Monate. Während Bewertungen durch Dritte auch Teil der Vorbereitungsarbeit sein können und Bereitstellungsentscheidungen informieren können, ist die hier beschriebene Arbeit im Allgemeinen langfristig und launch-unabhängig—sie konzentriert sich darauf, bestimmte Sicherheitsaussagen im Laufe der Zeit eingehend zu untersuchen. In unseren Prioritätsbereichen und Prinzipien beziehen wir uns auf Sicherheitsaussagen und Sicherheitsfälle. Was wir mit diesen Begriffen meinen, ist Folgendes: Wir schlagen vier Prioritätsbereiche für eine tiefere Bewertung vor, zusammen mit Prinzipien für strenge, sichere und unabhängige Arbeit. Unabhängige Bewertung von Sicherheitsfällen, die Training, Evaluierung, interne Bereitstellung und externe Bereitstellung umfassen. Die Bewertung von Sicherheitsfällen erfordert Expertise in Alignment, Kontrollmethoden wie Monitoring, Cybersicherheit, biologischem und chemischem Missbrauch und Red-Teaming. Sicherheitsfälle bestehen aus Aussagen einschließlich Training, Fähigkeitsbewertungen und Schutzmaßnahmen, die als Ganzes oder in Teilen bewertet werden können (siehe Prioritäten 2 und 3 unten). Mehrere Bewerter müssen wahrscheinlich verschiedene Teile der Fälle untersuchen und dabei auf ihre jeweilige Expertise zurückgreifen. Zusammen sollten ihre Bewertungen Fragen beantworten wie: Sind die Beweise für Sicherheitsfälle für Training, Evaluierung und Bereitstellungen belegt? Wurden die Bedingungen des Sicherheitsfalls während des Trainings, der Evaluierung...

FAQ F: Was sind OpenAIs Prioritäten für Bewertungen durch Dritte?

FAQ A: OpenAI schlägt vier Prioritätsbereiche für eine tiefere Bewertung vor, zusammen mit Prinzipien für strenge, sichere und unabhängige Arbeit. Dazu gehören die unabhängige Bewertung von Sicherheitsfällen, die Training, Evaluierung, interne Bereitstellung und externe Bereitstellung umfassen.