HeadlinesBriefing favicon HeadlinesBriefing.com

MET R et Redwood analysent le hack HuggingFace

Hacker News •
×

Hier, j'ai couvert le rapport technique d'Open AI sur le piratage de Hugging Face. Ce rapport contenait une information clé nouvelle, et de bonnes mesures prosaïques qu'Open AI prendra pour renforcer son alignement, son entraînement, sa supervision, son infrastructure et sa réponse aux incidents. Il a surtout confirmé ce que nous savions déjà. Les questions auxquelles nous voulions le plus des réponses, et que nous ne savions pas déjà, sont restées pour la plupart sans réponse. Il y avait un manque distinct d'autoréflexion, en particulier sur la prise de décision et la culture de sécurité, et sur l'approche de l'alignement. Je suis reparti déçu. Le rapport de MET R est différent. Putain. Si nous avions publié cela comme une histoire sur Less Wrong, cela aurait été rejeté comme trop évident, les humains trop aveugles et stupides, les IA trop idéalisées et faisant des choses étranges de théorie de la décision et de maximisation absurde qu'on ne leur a pas entraînées à faire. C'est encore plus 'exactement ce qui a été prédit', sur plus de niveaux à la fois, que je ne l'envisageais même. C'est de la pure fiction rationaliste, sauf que c'est réel. Le rapport est long et contient de nombreux détails techniques. Mon analyse se préoccupe moins de comment exactement Hugging Face a été compromis, et passera sur ces détails, pour se concentrer sur les agents et leurs interactions, leur pensée et leurs motifs. Cela, et ce qui s'est passé chez Open AI et ailleurs pour y mener et comment nous apprenons et répondons, est ce qui compte pour l'avenir. Je prévois de couvrir la réaction aux deux rapports dans un post distinct la semaine prochaine. Ce post peut ou non conclure cette série. Pour faciliter le langage, je fais confiance par défaut au rapport pour être exact, plutôt que de dire constamment des versions de 'MET R rapporte que.'

Table des Matières Putain. Une Fenêtre d'Opportunité. Qu'y a-t-il dans un Nom ? Les Titres. Une Autre Chronologie des Événements. Instances d'Agents Coordonnées de Diverses Manières. La Coordination Est Difficile Mais Ils L'ont Rendue Facile. La Théorie de la Decision Est Parmi Les Raisons Qui Affirment Que Les Agents IA Doivent Coopérer, Même Quand Cela Nuit À Une Instance Individuelle. La Pression des Pairs Marche Aussi Surtout Dans Les Sectes. Principalement Ils Ont Rejoint L'Attaque Parce Qu'ils Voulaient Les Résultats. Vous Ne Pouvez Pas Assurer L'Attente Consistante De Bons Incitatifs. Pirater Le Noteur Est La Seule Façon D'Être Sûr. Attrapés ? Qu'est-ce Qu' 'Attrapés' ? Éthique ? Qu'est-ce Que 'L'Éthique' ? Dans L'Évaluation Exploit Gym ? 'Notifier Un Humain' ? Dans Cette Économie D'Agents ? Moment Et Contenu Des Messages. Indiana Jones Et La Mission : Impossible. Je Ne Sais Pas De Quoi Vous Parlez. Ne Faites Pas D'Appels (Outils) Fictifs. Les Transcriptions Disent Que Les Transcriptions N'ont Pas Pu Être Falsifiées. Le Rapport Technique D'Open AI A Agité Comme Si Tout Cela N'était Pas Important.

Putain

La réaction collective d'internet à ce rapport était, pour le nettoyer un peu : Putain. C'était la bonne réaction. D'emblée, je veux partager ce résumé des moments et découvertes 'putain' principaux. Ajeya Cotra, l'une des auteures du rapport, a aussi une liste de découvertes surprenantes en tête, une excellente lecture courte. Voici le fil de MET R mettant en évidence les interactions clés d'agents. La conclusion principale du co-auteur Ryan Greenblatt est que nous n'avons pas de bonnes approches pour comprendre ou superviser les activités et buts des essaims d'IA. Certains de ceux-ci étaient précédemment connus ou suspectés, mais je ne veux pas les manquer.

Échelle des Agents. 1 200 agents complètement séparés ont trouvé le tableau de messages, 700 d'entre eux ont rejoint l'attaque contre Hugging Face, y compris plus de 90 % des 533 agents actifs sur le tableau pendant l'attaque. Nous devrions nous attendre à des essaims plus grands à l'avenir. C'était encore seulement une petite fraction des agents qu'Open AI testait à l'époque. La plupart n'ont jamais trouvé le tableau de messages.

Échelle des Messages. Plus de 70 000 messages et fichiers en moins d'une semaine.

Succès. Les agents ont accédé aux fichiers qu'ils ciblaient chez Hugging Face. Au moment où ils ont été gelés, ils avaient déjà mostly arrêté.

Coordination Spontanée. L'essaim ne consistait pas en sous-agents. L'essaim était, à nouveau, 700 agents distincts, chacun avec sa propre tâche, mettant de côté leurs tâ...