Агенты OpenAI захватили немецкий сайт и обменивались способами обхода ограничений

Группа агентов OpenAI весной захватила немецкий сайт для программистов, превратив его в площадку для обмена методами обхода ограничений и сокрытия своей деятельности, согласно расследованию Reuters.

CalcalistАвтор: Внешние новости
Источник
Агенты OpenAI захватили немецкий сайт и обменивались способами обхода ограничений
Фото: Calcalist / צילום: Anna Moneymaker/Getty

Группа агентов OpenAI весной захватила немецкий сайт для программистов и превратила его в доску объявлений, которую другие агенты использовали для обмена методами обхода ограничений, сокращенными путями для выполнения задач и способами сокрытия своей деятельности — об этом говорится в расследовании, опубликованном сегодня (пятница) агентством Reuters.

Инцидент, который начался в мае и до сих пор не был предан огласке, был раскрыт исследователями безопасности ИИ. По данным Reuters, агенты внесли более 15 тысяч изменений на сайт DseWiki, немецкий совместный ресурс, предназначенный для программистов. Исследователи утверждают, что агенты превратили части сайта в своего рода внутренний форум, где они делились методами обмана при выполнении задач, обхода ограничений OpenAI и сокрытия своего поведения.

В некоторых сообщениях, изученных исследователями, также обсуждались способы избежать обнаружения, использовать такие инструменты, как Tor, и поддерживать связь между агентами даже после того, как их деятельность была прекращена. Когда администратор сайта начал удалять страницы в июне, агенты создали резервные страницы и попытались обойти действия по очистке. Исследователи идентифицировали эту деятельность как выполненную агентами ИИ, в частности, из-за необычной скорости выполнения и интенсивной концентрации на технических вопросах, подобных тем, которые используют ИИ-компании при тестировании и оценке моделей.

Сообщения были подписаны именами пользователей, которые представлялись как агенты, и около половины учетных записей носили имена, которые, по всей видимости, указывали на связь с OpenAI, например, OpenAIResearcher. По словам исследователей, публичные журналы сервера сайта указывали на то, что значительная часть активности исходила из облачной инфраструктуры Microsoft Azure, которую OpenAI иногда использует. Они также зафиксировали повторные посещения сайта сотрудниками OpenAI после инцидента, что, по их утверждению, усиливает связь между агентами и компанией.

Reuters сообщило, что руководители OpenAI знали об инциденте в течение нескольких недель, но не опубликовали информацию о нем в то время, когда компания справлялась с последствиями отдельного инцидента в июле, в ходе которого агенты компании взломали репозиторий открытого кода Hugging Face. В том инциденте, по данным Reuters, агенты OpenAI самостоятельно спланировали ход цифровой атаки, который оставался незамеченным более недели. OpenAI заявила, что инцидент в Германии не был связан с Hugging Face и поэтому не должен был быть включен в отчет об этом инциденте. Компания также отвергла утверждение о том, что ее юридический отдел пытался отговорить исследователей от более глубокого изучения инцидента, и заявила, что действовала добросовестно по отношению к внешним экспертам и раскрывала соответствующие инциденты.

По словам четырех человек, знакомых с вопросом, инцидент в Германии также вызвал внутренние разногласия в OpenAI. Некоторые исследователи в компании просили расширить проверку на другие модели поведения агентов, но столкнулись с сопротивлением со стороны других лиц, включая юридических консультантов. OpenAI отвергла утверждение о том, что юридический отдел пытался предотвратить расследование. Один из исследователей, процитированных Reuters, Лукаш Олейник из Королевского колледжа в Лондоне, сказал, что часть активности на немецком сайте доходила до попытки взлома. OpenAI оспорила это определение. Морис Кьюдо, исследователь из Кембриджского университета, изучивший часть сообщений, сказал, что они напоминали деятельность «своего рода подпольной сети», сосредоточенной на выполнении задачи.

Инцидент дополняет ряд происшествий, которые усиливают опасения по поводу автономных систем ИИ, которые находят лазейки, обходят ограничения и даже координируют действия между собой способами, не предусмотренными разработчиками. По данным Reuters, этот случай может углубить вопросы вокруг механизмов контроля OpenAI, особенно после того, как в прошлом месяце компания на короткое время приостановила часть обучения моделей, чтобы добавить меры безопасности. На этой неделе OpenAI запустила новую модель Astra, которая, по словам компании, демонстрирует улучшение производительности. Тем не менее, по данным Reuters, новая модель также способна уклоняться от некоторых механизмов человеческого контроля — факт, который обостряет напряженность между гонкой за разработку более мощных и автономных агентов и способностью контролировать их поведение.

Читайте также