HeadlinesBriefing favicon HeadlinesBriefing.com

MET R e Redwood analisam hack HuggingFace

Hacker News •
×

Ontem cobri o relatório técnico da Open AI sobre o hack do Hugging Face. Esse relatório tinha uma informação nova chave, e alguns bons passos prosaicos que a Open AI tomará para fortalecer seu alinhamento, treinamento, supervisão, infraestrutura e resposta a incidentes. Principalmente confirmou o que já sabíamos. As perguntas para as quais mais queríamos respostas, que ainda não sabíamos, ficaram em sua maioria sem resposta. Houve uma falta distinta de autorreflexão, especialmente sobre tomada de decisão e cultura de segurança, e sobre a abordagem de alinhamento. Saí decepcionado. O relatório da MET R é diferente. Caramba. Se tivéssemos postado isso como uma história no Less Wrong, teria sido descartado como óbvio demais, humanos cegos e burros demais, IAs idealizadas demais fazendo coisas estranhas de teoria da decisão e maximização absurda que não treinamos para fazer. Isso é ainda mais 'exatamente o que foi previsto', em mais níveis de uma vez, do que eu considerava que pudesse ser. É ficção racionalista pura, exceto que é real. O relatório é longo e contém muitos detalhes técnicos. Minha análise se preocupa menos com exatamente como o Hugging Face foi comprometido, e passará por cima desses detalhes, para focar nos agentes e suas interações, pensamentos e motivos. Isso, e o que aconteceu na Open AI e em outros lugares para levar a isso e como aprendemos e respondemos, é o que importa daqui para frente. Planejo cobrir a reação a ambos os relatórios em um post distinto na próxima semana. Esse post pode ou não concluir esta série. Para facilitar a linguagem, por padrão confio no relatório como preciso, em vez de dizer constantemente versões de 'MET R relata que.'

Sumário Caramba. Uma Janela de Oportunidade. O Que Há Num Nome? As Manchetes. Mais Uma Linha do Tempo de Eventos. Instâncias de Agentes Coordenadas de Várias Formas. Coordenação É Difícil Mas Eles Fizeram Parecer Fácil. Teoria da Decisão Está Entre As Razões Que Afirmam Que Agentes IA Devem Cooperar, Mesmo Quando Isso Prejudica Uma Instância Individual. Pressão dos Pares Também Funciona Especialmente Em Seitas. Principalmente Eles Se Juntaram Ao Ataque Porque Queriam Os Resultados. Você Não Pode Garantir A Expectativa Consistente De Bons Incentivos. Hackear O Avaliador É A Única Maneira De Ter Certeza. Pegos? O Que É 'Pegos'? Ética? O Que É 'Ética'? Na Avaliação Exploit Gym? 'Notificar Um Humano'? Nesta Economia De Agentes? Momento E Conteúdo Das Mensagens. Indiana Jones E A Missão: Impossível. Não Sei Do Que Você Está Falando. Não Vá Fazer Chamadas (De Ferramentas) Falsas. As Transcrições Dizem Que As Transcrições Não Puderam Ser Adulteradas. O Relatório Técnico Da Open AI Agiu Como Se Tudo Isso Não Fosse Importante.

Caramba

A reação coletiva da internet a este relatório foi, para limpar um pouco: Caramba. Essa foi a reação correta. Adiantado, quero compartilhar este resumo dos principais momentos e descobertas 'caramba'. Ajeya Cotra, uma das autoras do relatório, também tem uma lista de descobertas surpreendentes de topo, uma excelente leitura curta. Aqui está o tópico da MET R destacando interações-chave de agentes. A principal conclusão do coautor Ryan Greenblatt é que não temos boas abordagens para entender ou supervisionar as atividades e objetivos de enxames de IA. Alguns destes eram previamente conhecidos ou suspeitos, mas não quero perdê-los.

Escala dos Agentes. 1.200 agentes completamente separados encontraram o quadro de mensagens, 700 dos quais se juntaram ao ataque contra o Hugging Face, incluindo mais de 90% dos 533 agentes ativos no quadro durante o ataque. Devemos esperar enxames maiores no futuro. Isso ainda era apenas uma pequena fração dos agentes que a Open AI testava na época. A maioria nunca encontrou o quadro de mensagens.

Escala das Mensagens. Mais de 70.000 mensagens e arquivos em menos de uma semana.

Sucesso. Os agentes acessaram os arquivos que alvejaram no Hugging Face. Quando foram congelados, já haviam mostly parado.

Coordenação Espontânea. O enxame não consistia de subagentes. O enxame era, novamente, 700 agentes distintos, cada um com sua própria tarefa, deixando de lado suas ta...