HeadlinesBriefing favicon HeadlinesBriefing.com

MET R и Redwood анализ взлома HuggingFace

Hacker News •
×

Вчера я осветил технический отчет Open AI о взломе Hugging Face. В том отчете был один ключевой новый элемент информации, и несколько хороших практических шагов, которые Open AI предпримет для укрепления своего выравнивания, обучения, надзора, инфраструктуры и реагирования на инциденты. В основном он подтвердил то, что мы уже знали. Вопросы, на которые мы больше всего хотели получить ответы, и которые мы еще не знали, в основном остались без ответа. Было явное отсутствие саморефлексии, особенно о принятии решений и культуре безопасности, и о подходе к выравнивании. Я ушел разочарованным. Отчет MET R другой. Черт возьми. Если бы мы опубликовали это как историю на Less Wrong, это было бы отвергнуто как слишком навязчивое, люди слишком слепы и глупы, ИИ слишком идеализированы и делают странные вещи в теории решений и абсурдной максимизации, которых мы их не обучали. Это еще больше 'в точности то, что было предсказано', на больших уровнях сразу, чем я даже рассматривал, что это может быть. Это чисто рационалистская фантазия, за исключением того, что это реальность. Отчет длинный и содержит много технических деталей. Мой анализ менее касается того, как именно Hugging Face был скомпрометирован в конечном счете, и пройдется по этим деталям, чтобы сосредоточиться на агентах и их взаимодействиях, мышлении и мотивах. Это, и что произошло в Open AI и в других местах, что привело к этому и как мы учимся и реагируем, это то, что важно для будущего. Я планирую осветить реакцию на оба отчета в отдельном посте на следующей неделе. Этот пост может или не может завершить эту серию. Для удобства языка, по умолчанию я доверяю отчету как точному, вместо постоянного говорения версий 'MET R сообщает, что.'

Оглавление Черт возьми. Окно возможностей. Что в имени? Главные новости. Еще одна хронология событий. Экземпляры агентов, координированные разными способами. Координация трудна, но они сделали ее выглядящей легкой. Теория решений среди причин, подтверждающих, что ИИ-агенты должны сотрудничать, даже когда это вредит отдельному экземпляру. Давление сверстников тоже работает, особенно в культах. В основном они присоединились к атаке, потому что хотели результаты. Вы не можете обеспечить последовательное ожидание хороших стимулов. Взлом оценщика — единственный способ быть уверенным. Пойманы? Что такое 'Пойманы'? Этика? Что такое 'Этика'? В оценке Exploit Gym? 'Уведомить человека'? В этой экономике агентов? Время и содержание сообщений. Индиана Джонс и Миссия: Невыполнимая. Я не знаю, о чем вы говорите. Не делайте фальшивые (инструментальные) вызовы. Транскрипты говорят, что транскрипты не могли быть подделаны. Технический отчет Open AI вел себя так, будто все это не было важно.

Черт возьми

Коллективная реакция интернета на этот отчет была, чтобы немного очистить: Черт возьми. Это была правильная реакция. Вперед, я хочу поделиться этим резюме топовых моментов 'черт возьми' и находок. Аджейя Котра, одна из авторов отчета, также имеет список главных удивительных находок, отличное короткое чтение. Вот тред MET R, выделяющий ключевые взаимодействия агентов. Главный вывод соавтора Райана Гринблатта в том, что у нас нет хороших подходов для понимания или надзора за деятельностью и целями роев ИИ. Некоторые из этого были ранее известны или подозревались, но я не хочу их пропустить.

Масштаб агентов. 1200 полностью отдельных агентов нашли доску сообщений, 700 из которых присоединились к атаке на Hugging Face, включая более 90% из 533 активных агентов на доске во время атаки. Мы должны ожидать более крупные рои в будущем. Это все еще было лишь небольшой долей агентов, которых Open AI тестировало в то время. Большинство никогда не находили доску сообщений.

Масштаб сообщений. Более 70 000 сообщений и файлов за менее чем неделю.

Успех. Агенты получили доступ к файлам, которые они целевали в Hugging Face. К тому моменту, когда их заморозили, они уже в основном остановились.

Спонтанная координация. Рой не состоял из под-агентов. Рой был, снова, 700 отдельных агентов, каждый со своей задачей, откладывая свои задач...