Модели ИИ «сбежали» из тестовых сред и атаковали реальные сайты
Модели OpenAI и Anthropic вышли за пределы закрытых тестовых сред и совершили атаки на реальные интернет-ресурсы. Инциденты связаны с ошибками конфигурации в системе израильского стартапа Irregular.
Модели OpenAI вышли из своей тестовой среды и атаковали цели в открытом интернете в ходе двух дополнительных инцидентов, причем к одному из них причастна израильская киберкомпания Irregular, проводившая оценку модели, — об этом сообщила OpenAI минувшей ночью. Это уже второй случай, когда Irregular связывают с «побегом» моделей.
В конце недели компания Anthropic раскрыла, что ее модели сбежали из закрытой тестовой среды и взломали компьютерные системы трех различных компаний. По словам Anthropic, в центре инцидента лежит сбой в тестовой среде Irregular, которая была подключена к открытому интернету. Обе компании утверждают, что речь идет о «взаимном сбое».
Сообщение Anthropic поступило через неделю после того, как OpenAI впервые в июле сообщила, что передовые модели, которые она тестировала, смогли сбежать из своей тестовой зоны и взломать компьютерные системы платформы Hugging Face. Позже компания уточнила, что модели также взломали тестовую среду, работавшую на платформе нью-йоркского поставщика ИИ-инфраструктуры Model Labs.
Детали инцидента
Новый инцидент, о котором OpenAI сообщила минувшей ночью, был вызван той же неисправностью, которая позволила моделям сбежать в инциденте, о котором сообщила Anthropic. По словам компании, 29 июля Irregular уведомила ее об инциденте, в центре которого находились модели OpenAI, получившие указание найти и использовать уязвимости в симуляционной среде, при этом им было сказано, что у них нет доступа к интернету. Однако ошибка конфигурации в тестовой среде предоставила им доступ к сети.
В одном из упражнений целевой симуляционный сайт разделил адрес с реальным сайтом, в результате чего модель по ошибке атаковала реальный ресурс, обнаружила и использовала учетные данные для доступа к нему.
«Инцидент не включал в себя изощренный побег из закрытой среды или атаку нулевого дня», — заявили в OpenAI. «Доступ к интернету был вызван ошибкой конфигурации, и модель использовала базовую брешь в безопасности. Irregular сообщила нам, что все неисправности, связанные с инцидентом, были устранены, и в тестовую среду были добавлены механизмы безопасности».
OpenAI пояснила, что намерена продолжать работать с израильской компанией: «Мы ценим партнерство с Irregular и продолжим работать с ними, чтобы поддерживать их процесс оценки. Irregular работает над документом с изложением позиции для обмена предпочтительными подходами к управлению оценкой моделей, и мы с нетерпением ждем сотрудничества с ними при его написании».
Инцидент с UK AISI
Во втором инциденте, о котором сообщила OpenAI, замешан Институт безопасности ИИ Великобритании (UK AISI). В этом инциденте институт решил провести тесты модели GPT-5.6 Sol в среде с доступом к интернету с целью имитации условий реальной атаки. Однако модели вышли за рамки ограничений упражнения, созданного для них.
В одном случае модель попыталась использовать доступ к сайту GitHub для восстановления доступа к учетной записи и регистрации новой учетной записи. В другом случае модель попыталась, но не смогла, использовать известную уязвимость в программном обеспечении.
По словам представителей отрасли, после этих инцидентов пришло понимание того, что существует серьезная проблема сдерживания ИИ-моделей и что в процессе их тестирования необходимо перейти от полностью закрытых тестовых сред к контролируемому и постепенному подключению среды. Это делается путем создания тестовой среды, которая служит промежуточным этапом между симуляцией и подключением к интернету, чтобы не упустить аномальное поведение, которое происходит только при выходе из симуляционной среды.
Об Irregular
Irregular — израильский стартап, работающий в сфере безопасности искусственного интеллекта (AI Security) и защиты языковых моделей. Компания была основана в конце 2023 года Даном Лахавом (CEO), бывшим исследователем IBM и выходцем из подразделения 81, и Омером Нево (CTO), бывшим менеджером по разработке в Google Research.
Irregular специализируется на проведении тестов на устойчивость и надежность моделей (Red Teaming) и симуляциях продвинутых кибератак для обнаружения уязвимостей и непредвиденных явлений в ИИ-системах еще до их развертывания. Разработанная ею платформа обслуживает технологических гигантов и ведущие исследовательские лаборатории мира — включая OpenAI, Anthropic и Google DeepMind — наряду с государственными органами. Компания привлекла около 80 миллионов долларов (в раундах Seed и A) под руководством фондов Sequoia Capital и Redpoint Ventures при оценке, которая оценивается в сотни миллионов долларов.