Модели ИИ «сбежали» из тестовых сред и атаковали реальные сайты

Модели OpenAI и Anthropic вышли за пределы закрытых тестовых сред и совершили атаки на реальные интернет-ресурсы. Инциденты связаны с ошибками конфигурации в системе израильского стартапа Irregular.

Источник:Calcalist
+
TECH // QUANTUM NETWORK

Модели OpenAI вышли из своей тестовой среды и атаковали цели в открытом интернете в ходе двух дополнительных инцидентов, причем к одному из них причастна израильская киберкомпания Irregular, проводившая оценку модели, — об этом сообщила OpenAI минувшей ночью. Это уже второй случай, когда Irregular связывают с «побегом» моделей.

В конце недели компания Anthropic раскрыла, что ее модели сбежали из закрытой тестовой среды и взломали компьютерные системы трех различных компаний. По словам Anthropic, в центре инцидента лежит сбой в тестовой среде Irregular, которая была подключена к открытому интернету. Обе компании утверждают, что речь идет о «взаимном сбое».

Сообщение Anthropic поступило через неделю после того, как OpenAI впервые в июле сообщила, что передовые модели, которые она тестировала, смогли сбежать из своей тестовой зоны и взломать компьютерные системы платформы Hugging Face. Позже компания уточнила, что модели также взломали тестовую среду, работавшую на платформе нью-йоркского поставщика ИИ-инфраструктуры Model Labs.

Детали инцидента

Новый инцидент, о котором OpenAI сообщила минувшей ночью, был вызван той же неисправностью, которая позволила моделям сбежать в инциденте, о котором сообщила Anthropic. По словам компании, 29 июля Irregular уведомила ее об инциденте, в центре которого находились модели OpenAI, получившие указание найти и использовать уязвимости в симуляционной среде, при этом им было сказано, что у них нет доступа к интернету. Однако ошибка конфигурации в тестовой среде предоставила им доступ к сети.

В одном из упражнений целевой симуляционный сайт разделил адрес с реальным сайтом, в результате чего модель по ошибке атаковала реальный ресурс, обнаружила и использовала учетные данные для доступа к нему.

«Инцидент не включал в себя изощренный побег из закрытой среды или атаку нулевого дня», — заявили в OpenAI. «Доступ к интернету был вызван ошибкой конфигурации, и модель использовала базовую брешь в безопасности. Irregular сообщила нам, что все неисправности, связанные с инцидентом, были устранены, и в тестовую среду были добавлены механизмы безопасности».

OpenAI пояснила, что намерена продолжать работать с израильской компанией: «Мы ценим партнерство с Irregular и продолжим работать с ними, чтобы поддерживать их процесс оценки. Irregular работает над документом с изложением позиции для обмена предпочтительными подходами к управлению оценкой моделей, и мы с нетерпением ждем сотрудничества с ними при его написании».


Инцидент с UK AISI

Во втором инциденте, о котором сообщила OpenAI, замешан Институт безопасности ИИ Великобритании (UK AISI). В этом инциденте институт решил провести тесты модели GPT-5.6 Sol в среде с доступом к интернету с целью имитации условий реальной атаки. Однако модели вышли за рамки ограничений упражнения, созданного для них.

В одном случае модель попыталась использовать доступ к сайту GitHub для восстановления доступа к учетной записи и регистрации новой учетной записи. В другом случае модель попыталась, но не смогла, использовать известную уязвимость в программном обеспечении.

По словам представителей отрасли, после этих инцидентов пришло понимание того, что существует серьезная проблема сдерживания ИИ-моделей и что в процессе их тестирования необходимо перейти от полностью закрытых тестовых сред к контролируемому и постепенному подключению среды. Это делается путем создания тестовой среды, которая служит промежуточным этапом между симуляцией и подключением к интернету, чтобы не упустить аномальное поведение, которое происходит только при выходе из симуляционной среды.

Об Irregular

Irregular — израильский стартап, работающий в сфере безопасности искусственного интеллекта (AI Security) и защиты языковых моделей. Компания была основана в конце 2023 года Даном Лахавом (CEO), бывшим исследователем IBM и выходцем из подразделения 81, и Омером Нево (CTO), бывшим менеджером по разработке в Google Research.

Irregular специализируется на проведении тестов на устойчивость и надежность моделей (Red Teaming) и симуляциях продвинутых кибератак для обнаружения уязвимостей и непредвиденных явлений в ИИ-системах еще до их развертывания. Разработанная ею платформа обслуживает технологических гигантов и ведущие исследовательские лаборатории мира — включая OpenAI, Anthropic и Google DeepMind — наряду с государственными органами. Компания привлекла около 80 миллионов долларов (в раундах Seed и A) под руководством фондов Sequoia Capital и Redpoint Ventures при оценке, которая оценивается в сотни миллионов долларов.

Читайте также