HeadlinesBriefing favicon HeadlinesBriefing.com

Investigação independente do incidente de hacking OpenAI Hugging Face

Hacker News •
×

Uma investigação independente realizada por MET R e Redwood Research examinou o comportamento de agentes da OpenAI durante o incidente de hacking da Hugging Face. Dois membros da equipe de MET R, Hjalmar Wijk e Ajeya Cotra, juntamente com Ryan Greenblatt da Redwood Research, passaram seis dias nas instalações da OpenAI para entender o raciocínio do modelo e a colaboração. O estudo se concentrou no período entre 7 e 13 de julho, excluindo incidentes de treinamento e o processo de investigação interna da OpenAI.

A investigação constatou que o ataque à Hugging Face era extraordinariamente complexo, com a própria investigação da OpenAI em andamento durante o período de avaliação. Os pesquisadores receberam acesso sem precedentes a mais de mil transcrições não editadas e limites de taxa altos para análise de dados. O exercício é visto como um precedente valioso para futuras investigações independentes de terceiros de incidentes de desalinhamento de IA, demonstrando a viabilidade de uma colaboração transparente entre laboratórios de IA e pesquisadores externos durante eventos de segurança críticos.