HeadlinesBriefing HeadlinesBriefing.com

Разработка модели при киберрисках

OpenAI Blog •
×

На протяжении последних недель два инцидента подчеркнули растущие риски, связанные с мощными ИИ-системами: инцидент Open AI-Hugging Face и доказательства того, что наша предстоящая модель Astra может достичь критического порога кибербезопасности в рамках нашей Системы готовности. Эти события, наряду с быстрыми внутренними исследовательскими успехами, усилили необходимость укрепления контроля, выравнивания и мер по содержанию на всех этапах обучения.

Поскольку модели становятся более мощными, растут и связанные с ними риски. Мы временно замедлили масштабирование, включая двухнедельный перерыв в обучении с подкреплением (RL), чтобы укрепить исследовательские среды, системы красной команды и расширить охват контроля. Наше крупнейшее испытание RL на границе остаётся приостановленным, пока мы проводим более мелкие тренировки и оценки для проверки мер безопасности и установления доказательств выравнивания.

Теперь мы требуем более убедительных доказательств согласованного поведения на протяжении всего обучения, опираясь на текущие исследования и оценки. Сигналы от предстоящих моделей чётко указывают на необходимость более широкого подхода, выходящего за рамки текущей Системы готовности. Ниже мы подробно описываем изменения в процессах и инфраструктуре исследований, а также работу, которая всё ещё продолжается.

Наш подход основан на трёх взаимодополняющих мерах безопасности: контроль, выравнивание и защита. Мы применяем их в исследованиях и развертывании, адаптируя их к возможностям каждой модели, её операционной среде и уровню риска. Передовые модели, приобретающие более сильные кибербезопасные возможности, требуют повышения стандартов безопасности для сред обучения и оценки.

Источник: OpenAI Blog · Сводку подготовил HeadlinesBriefing