HeadlinesBriefing HeadlinesBriefing.com

OpenAI stört Modell-Destillation

OpenAI Blog •
×

Wir haben kürzlich eine koordinierte Kampagne identifiziert und gestört, die darauf abzielte, geschützte Überlegungen aus unseren Modellen zu extrahieren, wobei die früheste beobachtete Aktivität in der ersten Woche des Juli stattfand. Diese Aktivität steht im Einklang mit adversarialer Destillation: der systematischen und unbefugten Nutzung der Ausgaben oder Überlegungen eines Modells, um ein anderes Modell zu trainieren, zu reproduzieren oder zu verbessern. Die Betreiber manipulierten die Modellinteraktionen, sodass geschützte Überlegungen in einer koordinierten, skalierten Weise in für den Anforderer sichtbaren Formen reproduziert werden konnten, was gegen unsere Nutzungsbedingungen verstieß.

Wir beobachteten, dass Betreiber versuchten, geschützte Überlegungen auf neuartige Weise zu extrahieren, darunter das Kopieren verschlüsselter Überlegungen aus einer Konversation und die Aufforderung an ein Modell in einer anderen Konversation, den verborgenen Überlegungsinhalt zu entschlüsseln und zu transkribieren. Die Aktivität begann am 1. Juli, mit hohen Volumenspitzen am 24. und 25. Juli, bestehend aus 16.000 Anfragen von über 4.000 Benutzern. Weitere Untersuchungen identifizierten verwandte Prompt-Muster-Aktivitäten in einem Cluster von über 15.000 Benutzern, den wir bis zum 28. Juli vollständig unterbrachen.

Wir schreiben einen Kerncluster der Aktivität Personen zu, die mit Moonshot AI, dem Entwickler von Kimi, in Verbindung stehen. Adversariale Destillation birgt Sicherheits- und nationale Sicherheitsrisiken. Extrahierte Überlegungen könnten verwendet werden, um ein anderes Modell zu trainieren, ohne die Sicherheitsvorkehrungen zu bewahren, die auf die benutzerorientierten Ausgaben des ursprünglichen Modells angewendet wurden.

Wir haben diese jüngste Destillationskampagne durch eine Kombination aus Account-Durchsetzung, technischen Kontrollen und Partnerkoordination abgeschwächt. Wir haben auch den Schutz für verborgene Überlegungen über Benutzer, Arbeitsbereiche, Organisationen und Modellfamilien hinweg gestärkt.

Quelle: OpenAI Blog · Zusammengefasst von HeadlinesBriefing