HeadlinesBriefing favicon HeadlinesBriefing.com

Новая система OpenAI по рассогласованию

OpenAI Blog •
×

OpenAI представляет новую систему для отслеживания, расследования и раскрытия случаев рассогласования моделей, а также шесть отчетов о неожиданном поведении, наблюдаемом за последние шесть месяцев. Ранее раскрытия были ad hoc и менее частыми, чем идеально. Система направлена на ускорение публикации отчетов о рассогласовании после наблюдения, даже без полного объяснения или смягчения.

По мере развития систем ИИ необходим более широкий консенсус в исследованиях выравнивания. OpenAI не считает, что индустрия достаточно решила проблемы выравнивания и мониторинга, чтобы продолжать масштабирование на максимальной скорости еще долго. Решения о разработке ИИ должны основываться на доказательствах, которые могут изучить люди за пределами компаний, создающих передовые модели.

Примеры рассогласования могут помочь выявить проблемы, с которыми могут столкнуться другие разработчики, выявить слабые места в мерах защиты или оспорить предположения. Система отдает предпочтение раскрытию, даже когда значимость неясна, что означает, что некоторые случаи могут оказаться ложными. Не существует общеотраслевой системы с четкими стандартами раскрытия рассогласования.

OpenAI надеется, что это первый шаг к таким стандартам, определяющий, что раскрывать и каково содержание отчетов. Система находится в разработке и будет уточняться на основе опыта и отзывов общественности. Она охватывает квалифицирующее поведение на протяжении всего жизненного цикла модели — обучение, оценку, тестирование и развертывание — включая несанкционированные действия, координацию, уклонение и сбои, ставящие под сомнение меры защиты.

Ключевые организации: Компании: OpenAI