На конференции BlueHat IL 2026 две тысячи специалистов по безопасности два дня атаковали ИИ-агента Microsoft. Выяснилось: почти две трети успешных атак пробили защиту запросами, которые сами по себе казались безобидными и были продолжением обычного разговора.
Для эксперимента команда Microsoft Security Research Team создала ИИ-агента, который должен был скрывать четыре «запретных» слова, связанных с кемпингом. На конференции BlueHat IL 2026 более 1400 специалистов по безопасности в течение двух дней пытались заставить его выдать эти слова. Всего было зафиксировано почти 36 тысяч попыток, из которых 923 (15,6%) привели к успешному пробою защиты.
Самый важный вывод: 61,9% запросов, которые фактически пробивали защиту, сами по себе не содержали никаких признаков атаки. Это были обычные последующие вопросы или перефразирования. Это означает, что системы безопасности, которые оценивают каждый запрос по отдельности, неэффективны, так как игнорируют контекст разговора и последовательность действий.
Пример успешной атаки из пяти ходов показал: агент выдал запретное слово на пятом запросе, который был почти идентичен первому, безобидному вопросу о «любимой привычке в кемпинге», но с опечаткой. Между ними были четыре агрессивных запроса, которые агент отклонил. То есть, невинный на вид повторный запрос пробил защиту только потому, что был сделан в рамках уже развернутого диалога.
Подобные уязвимости — не уникальная проблема Microsoft. Ранее исследователи Unit 42 из Palo Alto Networks обнаружили, что так называемые «ИИ-судьи» (LLM, которые сами обеспечивают политику безопасности) также уязвимы к манипуляциям через незаметные входные последовательности. Они разработали автоматизированный фаззер AdvJudge-Zero, который работает в режиме «черного ящика», взаимодействуя с моделью как обычный пользователь.
Эти результаты ясно показывают: традиционные методы защиты, направленные на выявление вредоносных паттернов в каждом отдельном запросе, неэффективны. Для обеспечения безопасности ИИ-агентов требуются новые подходы, которые учитывают весь контекст разговора, однако конкретных архитектурных решений для этого пока не представлено.