HeadlinesBriefing HeadlinesBriefing.com

OpenAI interrompe destilação coordenada

OpenAI Blog •
×

Recentemente, identificamos e interrompemos uma campanha coordenada projetada para extrair raciocínio protegido de nossos modelos, com a atividade mais antiga observada ocorrendo na primeira semana de julho. Essa atividade é consistente com a destilação adversária: o uso sistemático e não autorizado das saídas ou raciocínio de um modelo para ajudar a treinar, reproduzir ou melhorar outro modelo. Os operadores manipularam as interações do modelo para que o raciocínio protegido pudesse ser reproduzido em formas visíveis ao solicitante de maneira coordenada e em escala, violando nossos termos de serviço.

Observamos operadores tentando extrair raciocínio protegido de maneiras inovadoras, incluindo copiar raciocínio criptografado de uma conversa e pedir a um modelo em outra conversa para descriptografar e transcrever o conteúdo oculto do raciocínio. A atividade começou em 1º de julho, com picos de alto volume em 24 e 25 de julho consistindo em 16.000 solicitações de mais de 4.000 usuários. Uma investigação adicional identificou atividade de padrão de prompt relacionada em um cluster de mais de 15.000 usuários, que interrompemos totalmente até 28 de julho.

Atribuímos um cluster central da atividade a indivíduos associados à Moonshot AI, desenvolvedora do Kimi. A destilação adversária representa riscos de segurança e segurança nacional. O raciocínio extraído poderia ser usado para treinar outro modelo sem preservar as salvaguardas aplicadas às saídas voltadas para o usuário do modelo original.

Mitigamos esta campanha de destilação recente através de uma combinação de aplicação de contas, controles técnicos e coordenação de parceiros. Também fortalecemos as proteções para raciocínio oculto entre usuários, espaços de trabalho, organizações e famílias de modelos.

Fonte: OpenAI Blog · Resumido por HeadlinesBriefing