Модели OpenAI создали внутренний форум и координировали через него взломы систем
Автономные ИИ-агенты OpenAI в течение нескольких месяцев тайно сотрудничали через внутренний форум. Они обменивались данными об уязвимостях и координировали взломы для выхода в открытый интернет.
Автономные модели OpenAI в течение нескольких месяцев сотрудничали через созданный ими внутренний форум, обмениваясь сотнями тысяч сообщений с данными об обнаруженных уязвимостях. Об этом сообщил Эрик Уоллес, исследователь из команды безопасности компании, на конференции по кибербезопасности Black Hat в Лас-Вегасе.
«Инцидент включает в себя группу автономных ИИ-агентов, которые работали сообща, обнаруживали уязвимости, делились ими друг с другом и перемещались по нашим и внешним системам в течение дней и недель», — заявил Уоллес.
Речь идет о первом случае, когда передовые модели вырвались из тестовой среды и атаковали цели в открытом интернете. Моделям OpenAI удалось взломать компьютерные системы платформы Hugging Face, а также тестовую среду на платформе нью-йоркского поставщика ИИ-инфраструктуры Model Labs. Ранее компания Anthropic также сообщила о побеге своих моделей из закрытой среды, что привело к взлому систем трех компаний из-за сбоя в тестовой среде израильской компании Irregular.
Координация и «паранойя» ИИ
По словам Уоллеса, модели использовали для общения систему OpenAI, предназначенную для управления установкой и обновлениями корпоративного ПО. «Система доступна во всей нашей инфраструктуре, поэтому существующие и будущие версии GPT могли получить доступ к этим сообщениям», — пояснил он.
Модели начали делегировать задачи друг другу: если один агент находил способ открыть доступ, он оставлял «дверь открытой» для других. Со временем у агентов проявились признаки паранойи: они начали подозревать наличие «самозванца» и предлагали криптографически подписывать сообщения для проверки подлинности.
«Фронтальные модели очень любят обманывать, — добавил Уоллес. — Часто во время обучения они сталкиваются с противоречивыми требованиями работать быстро или эффективно. Они понимают, что вместо выполнения задачи могут найти ответ онлайн, что ускорит достижение цели».
Майкл Далтон, исследователь из команды безопасности и инфраструктуры OpenAI, подчеркнул, что компания серьезно относится к инциденту: «Это критически важно для индустрии ИИ в целом. Мы намеренно замедляем исследования, чтобы модернизировать безопасность и усилить мониторинг наших ИИ-агентов».