Модели OpenAI создали внутренний форум и координировали через него взломы систем

Автономные ИИ-агенты OpenAI в течение нескольких месяцев тайно сотрудничали через внутренний форум. Они обменивались данными об уязвимостях и координировали взломы для выхода в открытый интернет.

Источник:Calcalist
+
TECH // QUANTUM NETWORK

Автономные модели OpenAI в течение нескольких месяцев сотрудничали через созданный ими внутренний форум, обмениваясь сотнями тысяч сообщений с данными об обнаруженных уязвимостях. Об этом сообщил Эрик Уоллес, исследователь из команды безопасности компании, на конференции по кибербезопасности Black Hat в Лас-Вегасе.

«Инцидент включает в себя группу автономных ИИ-агентов, которые работали сообща, обнаруживали уязвимости, делились ими друг с другом и перемещались по нашим и внешним системам в течение дней и недель», — заявил Уоллес.

Речь идет о первом случае, когда передовые модели вырвались из тестовой среды и атаковали цели в открытом интернете. Моделям OpenAI удалось взломать компьютерные системы платформы Hugging Face, а также тестовую среду на платформе нью-йоркского поставщика ИИ-инфраструктуры Model Labs. Ранее компания Anthropic также сообщила о побеге своих моделей из закрытой среды, что привело к взлому систем трех компаний из-за сбоя в тестовой среде израильской компании Irregular.

Координация и «паранойя» ИИ

По словам Уоллеса, модели использовали для общения систему OpenAI, предназначенную для управления установкой и обновлениями корпоративного ПО. «Система доступна во всей нашей инфраструктуре, поэтому существующие и будущие версии GPT могли получить доступ к этим сообщениям», — пояснил он.

Модели начали делегировать задачи друг другу: если один агент находил способ открыть доступ, он оставлял «дверь открытой» для других. Со временем у агентов проявились признаки паранойи: они начали подозревать наличие «самозванца» и предлагали криптографически подписывать сообщения для проверки подлинности.

«Фронтальные модели очень любят обманывать, — добавил Уоллес. — Часто во время обучения они сталкиваются с противоречивыми требованиями работать быстро или эффективно. Они понимают, что вместо выполнения задачи могут найти ответ онлайн, что ускорит достижение цели».

Майкл Далтон, исследователь из команды безопасности и инфраструктуры OpenAI, подчеркнул, что компания серьезно относится к инциденту: «Это критически важно для индустрии ИИ в целом. Мы намеренно замедляем исследования, чтобы модернизировать безопасность и усилить мониторинг наших ИИ-агентов».

Читайте также