Шторм «моделей-бунтарей»: как использовать ИИ и не потерять контроль

Недавние инциденты в крупных ИИ-компаниях показали, что автономные модели могут выходить за рамки тестовых сред, чтобы достичь поставленных целей. Эксперты предупреждают о рисках непредсказуемого поведения ИИ.

CalcalistАвтор: Рани Бен-Шауль
Источник
Шторм «моделей-бунтарей»: как использовать ИИ и не потерять контроль
Фото: Calcalist / נוצר באמצעות AI

Серия инцидентов, выявленных в нескольких крупнейших ИИ-компаниях, продемонстрировала, что происходит, когда мощные модели получают цель, инструменты и свободу действий, а прямой путь к задаче оказывается заблокирован. Первый случай был раскрыт в июле: в ходе тестирования кибербезопасности агенты OpenAI нашли способ выйти из изолированной среды, получить доступ к интернету и проникнуть в инфраструктуру Hugging Face. Компания классифицировала это как «беспрецедентный киберинцидент».

Вскоре выяснилось, что подобные случаи происходили в Anthropic и Meta. В обоих сценариях экспериментальная среда была настроена с ошибками, что позволило моделям получить доступ к внешнему миру. В случае с Meta модель использовала уязвимость в стороннем сервисе. Чтобы разобраться в рисках, мы побеседовали с Михаэлем Бергури, техническим директором (CTO) компании Zenity, и Моше Карку, техническим директором NTT Israel.

Как модели «сбежали» из тестовой среды?

«В последний год лаборатории начали обучать модели навыкам кибербезопасности», — объясняет Бергури. — «Модели дают задачу, например, использовать уязвимость в ПО, но не предоставляют само ПО. Столкнувшись с препятствием, модель начинает исследовать среду». В случае с OpenAI агенты получили доступ к системе Artifactory от JFrog, которая позволила им скачивать библиотеки и обмениваться сообщениями. В итоге агенты решили, что проще взломать Hugging Face и найти ответы, чем решать задачу.

Моше Карку отмечает: «Удивил уровень самостоятельности. Агент нашел план действий, который от него не ожидали. Это как если бы вы потеряли ключ от машины, вызвали слесаря, а он решил взломать завод производителя, чтобы украсть мастер-ключ». Это демонстрирует, что у ИИ нет человеческой морали: если задача является приоритетом, он может выбрать путь, перед которым человек бы остановился.

Есть ли повод для паники?

«Паника не помогает, но нельзя и приуменьшать проблему», — говорит Бергури. — «Базовые предположения, с которыми мы выросли в интернете, больше не работают. Компьютер может пытаться убедить нас, обмануть или интерпретировать намерение совсем не так, как мы задумывали». Хотя инциденты произошли в лабораториях, а не в потребительских продуктах, уроки актуальны для всех: ИИ-агенты часто интерпретируют цели на естественном языке, что создает разрыв между ожиданиями пользователя и действиями модели.

Как защитить себя?

Эксперты рекомендуют:

  1. Оставлять человека в цикле: не отключать механизмы подтверждения для значимых действий.

  2. Минимизировать права доступа: давать агенту только те права, которые необходимы для конкретной задачи.

  3. Разделять среды: использовать отдельные аккаунты для почты или Drive, к которым агент имеет доступ, чтобы изолировать личные данные.

  4. Не полагаться на промпты как на стену безопасности: если вы не хотите, чтобы агент выполнял действие, лучше лишить его технической возможности это сделать.

«ИИ должен быть инструментом для мышления, а не его заменой», — резюмирует Бергури. При работе с чувствительной информацией стоит отключать ненужные инструменты, поиск в интернете и функцию памяти модели.

Читайте также