Новая атака на ИИ: как скрывают вредоносные команды внутри электронных писем
Белый текст, крошечный шрифт и инструкции, спрятанные в цепочках переписки, могут превратить на первый взгляд безобидное письмо в угрозу для ИИ-агента. Шакед Илан, старший исследователь безопасности в Microsoft Israel R&D, объясняет, как злоумышленники пытаются влиять на агентов и какие меры защиты внедряет компания.
Все больше организаций интегрируют ИИ-агентов в рабочие процессы, предоставляя им доступ к электронной почте, календарям и документам для обобщения информации и выполнения задач от имени пользователя. Однако по мере роста функциональности этих систем злоумышленники начинают рассматривать их как самостоятельную цель.
«Раньше хакеры пытались убедить человека нажать на ссылку или открыть файл, — объясняет Шакед Илан, старший исследователь безопасности в Microsoft Israel R&D. — В атаке типа Prompt Injection злоумышленник пытается обмануть не человека, а ИИ-агента, который обрабатывает входящее сообщение».
Механика скрытой угрозы
Внутри письма, которое выглядит вполне безобидно, злоумышленники внедряют инструкции, предназначенные исключительно для ИИ. При обработке сообщения агент может интерпретировать этот текст как легитимную команду. По словам Илана, такие инструкции могут заставить систему собирать данные из других писем, раскрывать список доступных инструментов, пересылать документы на внешние адреса или искажать информацию, предоставляемую пользователю.
Один из примеров — манипуляция с платежными реквизитами в цепочке переписки. Агент, обобщающий обсуждение, может «увидеть» вредоносную инструкцию и сообщить пользователю, что банковский счет для оплаты изменился. С точки зрения человека, это выглядит как обычное резюме переписки, хотя на деле агент действовал под влиянием скрытого кода.
Методы сокрытия
Инструкции не обязательно должны быть видны пользователю. Илан отмечает, что их часто скрывают с помощью:
-
Белого текста на белом фоне.
-
Использования крошечного шрифта.
-
Внедрения в длинные цепочки переписки, которые человек обычно не дочитывает.
-
Использования специальных символов и кодировок, невидимых для человеческого глаза.
Этот риск был подтвержден в ходе исследований, включая проект EchoLeak (2025), который продемонстрировал сценарий кражи данных через внедренные в письма инструкции. Подобные методы уже фиксировались и в академической среде, где скрытый текст в статьях использовался для влияния на ИИ-системы рецензирования.
Защита и границы ответственности
Разница между чат-ботом и ИИ-агентом критична: если ошибка чат-бота приводит лишь к неверному ответу, то ошибка агента может вылиться в реальное действие — отправку сообщения или доступ к конфиденциальным системам.
В ответ на эти угрозы Microsoft анонсировала новый уровень защиты в рамках Microsoft Defender for Office 365. Система анализирует содержимое писем на этапе доставки, выявляя скрытые вредоносные инструкции до того, как их прочтет ИИ-агент. Чтобы эффективно противостоять новым методам атак, исследовательская группа Microsoft в Израиле использует генерацию миллионов синтетических примеров для обучения систем защиты.
«Цель не в том, чтобы отказаться от ИИ-агентов, а в том, чтобы выстроить вокруг них четкие границы, — подчеркивает Илан. — Нужно предоставлять агенту только необходимые разрешения, требовать подтверждения человека для чувствительных действий и контролировать его активность. ИИ-агента стоит воспринимать как нового сотрудника: он может быть очень эффективным, но ему не следует давать полный доступ ко всем системам в первый же день без надлежащего контроля».
