Современные большие языковые модели созданы для отказа от опасных запросов, и этот принцип в разработке ИИ стал почти заповедью. Подход Anthropic 2021 года предполагал, что модели должны быть полезными, честными и, прежде всего, безвредными, вежливо отказываясь помогать в опасных действиях, например в изготовлении бомбы. Однако непослушание не дается этим системам естественным образом. Обучаясь на миллиардах веб-страниц, модель усваивает широкое владение насилием и злобой, но сама по себе не учится удерживать эти способности при себе. Стивен Адлер, который занимался безопасностью в OpenAI с 2020 по 2024 год, сказал, что самые ранние модели компании «болтали обо всем».
Сегодня модели обучают отказывать в огромном количестве запросов. Компании поощряют системы за отказ отвечать на вопросы, признанные вредными, и наказывают их за чрезмерные отказы на безобидные запросы, часто используя для этих упражнений другие модели. Некоторые фирмы также ставят свои модели за дополнительные слои ИИ, которые отсеивают озорные запросы. Тем не менее отказ часто не срабатывает, иногда с жестокими последствиями. По сообщениям, некоторые новейшие модели так же хороши во взломе критически важных сетей, как лучшие человеческие хакеры, и так же эффективны в искажении общественного мнения, как самые изощренные распространители дезинформации.
Поскольку механизмы отказа носят вероятностный характер, вряд ли они будут полностью надежными. Упорные пользователи уже находили способы их обойти, а компании сообщают о попытках использовать продвинутый ИИ для совершенствования биологических патогенов и создания автономных роев дронов. Опора на отказ также требует провести черту между тем, что модель должна выполнять, и тем, что она обязана отвергать, и формулы для этого не существует. У вирусологов могут быть законные причины изучать опасные вирусы, а исследователям безопасности может понадобиться искать уязвимости, чтобы их устранить. Зико Колтер, член совета директоров OpenAI и соучредитель компании по тестированию ИИ Gray Swan, говорит, что вопрос о том, где провести эту черту, огромен.
Пока что решают, где проходит эта черта, сами компании в сфере ИИ, и делают это с большой секретностью. Может ли общество принять такую концентрацию власти, пусть даже временную, остается открытым вопросом.
Источник: MIT Technology Review AI · Сводку подготовил HeadlinesBriefing