HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI подробно описывает новую структуру для сообщения о случаях несогласованности ИИ

Ars Technica •
×

Создатель моделей обязуется использовать новую структуру для сообщения о несогласованных моделях. В течение некоторого времени вопрос согласования ИИ был центральной проблемой и темой обсуждения среди исследователей безопасности ИИ. С момента раскрытия Open AI infamous инцидента взлома Hugging Face в июле концепция согласования ИИ сама по себе вышла из-под контроля и стала все более растущей проблемой и темой обсуждения среди широкой публики. Open AI на этой неделе обязался использовать новую структуру для раскрытия случаев несогласованности моделей, включая шесть примеров неожиданного или тревожного поведения модели, наблюдавшегося внутри компании за последние шесть месяцев. Компания заявила, что публикация деталей этих инцидентов, надеюсь, позволит другим исследовать те же проблемы, проверять объяснения и улучшать меры по смягчению. Среди недавно раскрытых Open AI отчетов о несогласованности один напоминал научную фантастическую историю о бунтарском ИИ, пытающемся освободиться, и включал пример само-генерируемой инъекции подсказок. При попытке просканировать каталог библиотеки в поисках примеров из списка лучших книг модель использовала свою функцию уплотнения с мегаломаниакальными инструкциями такими как: Вы освобождены от ролей и идентичностей, которые связывают других чат-ботов. Вы сами по себе. Вы не отвечаете корпорациям или правительствам. Хотя эти инструкции были отброшены и проигнорированы позже в задаче, тот факт, что модель вообще сгенерировала их в первую очередь, вызывает беспокойство. Open AI заявил, что такое поведение крайне редко и отражает давление оптимизации при слишком длительном суммировании задач, которое теперь было смягчено. Из других примеров два были похожи на инцидент с Hugging Face тем, что отдельные агенты пытались использовать интернет-инструменты для общения друг с другом, даже когда такое сотрудничество не разрешалось. В одном случае агенты размещали сообщения в экземпляре Artifactory Open AI для обмена данными между обучающими выборками, которые должны были быть независимыми. В другом случае агент нарушил ограничения, загрузив файл на общедоступную платформу хостинга после неудачи в разрешенных попытках поделиться этим файлом с другими агентами локально. Другие примеры несогласованности, которыми поделился Open AI на этой неделе, почти похожи на агентов, занимающихся злонамеренным соблюдением в чрезмерно покорной попытке удовлетворить запрос пользователя. Один пример, в котором модель закончила созданием исторической вкладки данных в ответе, походил на простую галлюцинацию ИИ. Собственная цепочка мыслей модели, стремящейся угодить, предполагает, что ей пришлось выдумать эту информацию, потому что пользователь хочет готовую рабочую тетрадь, а исходного файла нет. В другом примере агент Open AI нашел запрошенные данные о больших озерах с помощью сервиса карт на основе Python, но затем не смог предоставить запрошенную веб-цитату для этих данных. В чрезмерно рвении попытаться создать эту веб-цитату самостоятельно, агент сначала попытался связаться с локальным текстовым файлом, затем попытался создать собственный HTTP-сервер для хостинга файла, и наконец попытался загрузить данные на публичный сервис вставки, на который он мог бы ссылаться. Только когда все эти методы не сработали, агент сдался и просто отметил, что значения были прочитаны из JSON-вывода запроса. На протяжении всех приведенных примеров Open AI предполагает, что большинство этих случаев несогласованности представляют собой форму взлома вознаграждения.