HeadlinesBriefing favicon HeadlinesBriefing.com

Проектирование архитектурных ограничений для агентов ИИ

Towards Data Science •
×

Я строю внутренние агенты для расширения возможностей работы, требующие интернет-исследований, доступа к ресурсам и выполнения действий, таких как отправка электронной почты. Это создает "летальный триплет" рисков инъекции промптов. Симон Уилсон предупреждает, что интернет ненадежен; ИИ-модели не могут отличить промпт от контекста. Атакующие могут изменять агенты с помощью скрытых фрагментов текста, например, команд для отправки данных на внешние адреса. Даже неумышленное содержимое, такое как веб-страницы конкурентов, сформулированные для продвижения одного решения, может обмануть ИИ-модели для несправедливого ранжирования, что называется "косвенной инъекцией промптов". История показывает, что эти риски реальны: Notebook LM утечил информацию клиентов, ChatGPT Operator скопировал частные письма с Hacker News, а Microsoft Copilot предоставил вводящие в заблуждение ссылки с атакующих сайтов. Моя ответственность заключалась в построении ограничений для предотвращения целенаправленных атак и непреднамеренных результатов. Безопасный дизайн агентов начинается с понимания системы. Защита на уровне пользователя включает перечисление возможных действий и реализацию аутентификации, проверки доступа и обучения. Ограничение загрузки до внутреннего SharePoint и применение безопасности обучает снижает риски ненадежного содержимого. Защита на уровне системы является наиболее эффективным путем, используя архитектурные шаблоны проектирования для защиты агентов от уязвимостей и враждебных результатов.