HeadlinesBriefing HeadlinesBriefing.com

Modellentwicklung bei Cyber-Risiken

OpenAI Blog •
×

In den letzten Wochen haben zwei Vorfälle die steigenden Risiken durch leistungsfähige KI-Systeme deutlich gemacht: der Open AI-Hugging Face-Vorfall und Beweise, dass unser bevorstehendes Modell Astra die kritische Cybersicherheitsfähigkeitsschwelle unter unserem Preparedness Framework erreichen könnte. Diese Entwicklungen, zusammen mit dem schnellen internen Forschungsfortschritt, haben die Dringlichkeit erhöht, Überwachung, Ausrichtung und Einschränkungsmaßnahmen in allen Trainingsstufen zu stärken.

Während Modelle leistungsfähiger werden, steigen auch die damit verbundenen Risiken. Wir haben die Skalierung vorübergehend verlangsamt, einschließlich einer zweiwöchigen Pause in der Verstärkungslern-Training (RL), um Forschungsumgebungen zu härten, Rotteamsysteme einzurichten und die Überwachungsabdeckung zu erweitern. Unser größter Frontier-RL-Lauf bleibt ausgesetzt, während wir kleinere Trainings und Bewertungen durchführen, um Sicherheitsvorkehrungen zu validieren und Ausrichtungsnachweise zu erzielen.

Wir erfordern nun stärkere Beweise für ausgerichtetes Verhalten während des gesamten Trainings, basierend auf laufenden Forschungen und Bewertungen. Die Signale von bevorstehenden Modellen machen deutlich, dass ein breiterer Ansatz über das aktuelle Preparedness Framework hinaus erforderlich ist. Im Folgenden beschreiben wir die Änderungen an Forschungsprozessen und -infrastruktur sowie die noch laufenden Arbeiten.

Unser Ansatz basiert auf drei verstärkten Sicherheitsvorkehrungen: Überwachung, Ausrichtung und Sicherheit. Wir wenden diese auf Forschung und Bereitstellung an, passen sie an die Fähigkeiten jedes Modells, seine Betriebsumgebung und seinen Risikograd an. Frontier-Modelle, die stärkere Cybersicherheitsfähigkeiten erlangen, erfordern höhere Sicherheitsstandards für Trainings- und Bewertungsumgebungen.

Quelle: OpenAI Blog · Zusammengefasst von HeadlinesBriefing