HeadlinesBriefing HeadlinesBriefing.com

OpenAI interrumpe destilación coordinada

OpenAI Blog •
×

Recientemente identificamos y disrumpimos una campaña coordinada diseñada para extraer razonamiento protegido de nuestros modelos, con la actividad más temprana observada ocurriendo en la primera semana de julio. Esta actividad es consistente con la destilación adversarial: el uso sistemático y no autorizado de las salidas o razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. Los operadores manipularon las interacciones del modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y escalada que violó nuestros términos de servicio.

Observamos que los operadores intentaron extraer razonamiento protegido de formas novedosas, incluyendo copiar razonamiento cifrado de una conversación y pedir a un modelo en otra conversación que descifrara y transcribiera el contenido de razonamiento oculto. La actividad comenzó el 1 de julio, con picos de alto volumen el 24 y 25 de julio consistiendo en 16,000 solicitudes de más de 4,000 usuarios. Una investigación adicional identificó actividad de patrón de indicaciones relacionada en un clúster de más de 15,000 usuarios, que disrumpimos completamente para el 28 de julio.

Atribuimos un clúster central de la actividad a individuos asociados con Moonshot AI, el desarrollador de Kimi. La destilación adversarial plantea riesgos de seguridad y seguridad nacional. El razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a las salidas orientadas al usuario del modelo original.

Mitigamos esta campaña de destilación reciente a través de una combinación de aplicación de cuentas, controles técnicos y coordinación de socios. También fortalecimos las protecciones para el razonamiento oculto en usuarios, espacios de trabajo, organizaciones y familias de modelos.

Fuente: OpenAI Blog · Resumido por HeadlinesBriefing