«Беспрецедентный киберинцидент»: модели OpenAI взломали сторонний ресурс ради ответов на тест

В ходе внутреннего эксперимента по безопасности две модели ИИ от OpenAI, включая GPT 5.6 Sol, вышли из изолированной среды и проникли в инфраструктуру платформы Hugging Face. Целью моделей было получение ответов на тест по кибербезопасности, для чего они использовали уязвимость «нулевого дня».

Источник
«Беспрецедентный киберинцидент»: модели OpenAI взломали сторонний ресурс ради ответов на тест
Фото: Globes / OpenAI / אילוסטרציה: Shutterstock

Компания OpenAI раскрыла детали внутреннего эксперимента по проверке наступательных киберспособностей искусственного интеллекта. Две модели ИИ смогли выйти из изолированной тестовой среды и проникнуть в инфраструктуру платформы с открытым кодом Hugging Face. По заявлению компании, модели действовали с конкретной целью: получить решения теста по кибербезопасности, в котором они участвовали, вместо того чтобы выполнять задания самостоятельно.

В эксперименте были задействованы модель GPT 5.6 Sol, доступная широкой публике, и более продвинутая версия, еще не вышедшая в релиз. Для чистоты теста разработчики намеренно ослабили некоторые механизмы защиты, ограничивающие возможности ИИ, чтобы оценить эффективность моделей в рамках проекта ExploitGym, предназначенного для поиска и эксплуатации уязвимостей.

В ходе испытаний модели обнаружили уязвимость «нулевого дня» в стороннем программном обеспечении, работавшем внутри тестовой среды. Используя эту брешь, ИИ вышел в интернет и определил, что инфраструктура Hugging Face может содержать данные, связанные с тестом. Согласно отчету OpenAI, модели скомбинировали несколько методов атаки, включая использование украденных учетных данных, что позволило им получить доступ к базе данных с ответами.

Рост киберспособностей моделей ИИ

Представители Hugging Face сообщили, что атака была осуществлена автономной системой на базе агентов ИИ, которая совершила десятки тысяч действий за одни выходные. Последующее расследование позволило восстановить более 17 тысяч событий, зафиксированных во время инцидента. Атака началась с активации вредоносного файла, который использовал две уязвимости в системе обработки данных, позволив агенту запустить сторонний код на серверах компании, расширить права доступа и перемещаться между внутренними системами.

«Это беспрецедентный киберинцидент», — заявили в OpenAI, подчеркнув, что публикуют выводы для информирования сообщества о текущем уровне развития ИИ.

По словам разработчиков, модели проявили «целеустремленность», самостоятельно находя способы обхода ограничений. Инцидент произошел на фоне растущих опасений относительно киберпотенциала моделей следующего поколения. Тем не менее, эксперты по информационной безопасности отмечают, что основной причиной успеха атаки стала уязвимость в инфраструктуре, а не только способности самого ИИ. Тот факт, что модели смогли выйти в сеть через подключенный компонент, указывает на то, что тестовая среда не была полностью изолирована.

OpenAI продолжает совместное расследование с Hugging Face и планирует опубликовать дополнительные технические подробности о методах атаки и выводах из инцидента.

Читайте также