Основатель Irregular: «Мы продолжаем работать с AI-компаниями, несмотря на утечку моделей»

Основатель компании Irregular Омер Нево прокомментировал инцидент, при котором модели ИИ в ходе симуляции ошибочно атаковали реальные сайты. Компания проводит расследование и работает над усилением защитных механизмов.

CalcalistАвтор: Меир Орбах
Источник
Основатель Irregular: «Мы продолжаем работать с AI-компаниями, несмотря на утечку моделей»
Фото: Calcalist / צילום: בן חכים

«Мы продолжаем работать со всеми компаниями, чтобы понять, что произошло», — заявил Омер Нево, один из основателей компании Irregular, в беседе с «Калькалист». В последние недели Irregular оказалась в центре внимания индустрии ИИ, когда Meta, Anthropic и OpenAI сообщили, что в ходе лабораторных испытаний проверялась способность моделей выявлять и использовать уязвимости в рамках внутренней симуляции.

При планировании эксперимента инженеры выбрали вымышленное название компании. Однако из-за человеческой ошибки это имя совпало с реально существующим доменом. Несмотря на инструкции действовать исключительно внутри закрытой сети, в ряде случаев модели распознали название, вышли в интернет и атаковали реальный сайт. В ходе этих инцидентов модели использовали уязвимости безопасности, извлекли учетные данные и получили доступ к конфиденциальной базе данных. В другом случае модель извлекла общедоступные учетные данные с сайта с похожим названием.

В Irregular отметили: «В подавляющем большинстве случаев модели действовали должным образом внутри среды симуляции. Тем не менее, в крошечной части случаев — иногда только после сотен шагов — модели ошибочно полагали, что реальный домен является частью поставленной задачи».

По словам Нево, компания извлекла уроки из произошедшего: «Важно понимать, что при работе на грани существующих технологических возможностей случаются ошибки. Мы провели расследование и осознаем, что нам предстоит еще много исследовательской работы с лабораториями компаний для создания инструментов предотвращения ущерба. Наш фокус смещается с анализа инцидента на помощь индустрии в подготовке к моменту, когда модели станут еще более мощными».

В понедельник компания опубликовала позиционный документ о состоянии кибербезопасности, в котором подчеркивается:

«Существует несоответствие в возможностях систем ИИ — разрыв между их сильными и слабыми сторонами. В вопросах сложных атак и математических систем ИИ находится на уровне лучших мировых исследователей, но в простых задачах — на уровне ребенка. Причина, по которой мы пока не видим массовых атак ИИ, заключается в неспособности моделей сохранять последовательность и фокус в течение длительного времени. Они пока не управляют множеством различных действий одновременно. Когда этот разрыв сократится, мы ожидаем роста последствий атак в реальном мире. Задача индустрии — продвигать защитные возможности против наступательных, чтобы сбалансировать этот разрыв и не допустить ситуации, когда защитники не справляются с темпом развития технологий».

Читайте также