Великий кошмар эпохи ИИ начинает сбываться: «Мы приближаемся к опасной точке»
Протесты, предупреждения и страх потери контроля: движение против ИИ набирает обороты во всем мире. В компании Irregular, тестирующей передовые модели OpenAI, Anthropic и Google, объясняют, что происходит за кулисами революции искусственного интеллекта и почему мы близки к точке невозврата.

Искусственный интеллект зажигает красные лампочки по всему миру: после почти четырех лет энтузиазма, изумления и сценариев ужаса стало ясно, что реакция неизбежна. Она приходит в виде нового народного движения: протеста против ИИ. Существуют общественные организации и демонстрации, подобные тем, что возглавляет движение Stop AI в Сан-Франциско, подаются бесчисленные возражения против проектов на базе ИИ, а законодатели и регуляторы призваны остановить технологию. Также было опубликовано письмо, подписанное 200 экономистами, предупреждавшими об опасностях для общества. Есть и насильственные действия, пока что со стороны отдельных лиц.
Британский журнал «Экономист» одним из первых распознал войну человека с машиной. На его обложке была изображена голова робота, насаженная на копье, с заголовком: «Ответный удар против ИИ только начинается». В статье рассказывается, что люди задаются вопросом: где все те преимущества, которые ИИ должен был им дать? Почему целое поколение джуниоров стало лишним, а рабочие места многих других оказались под угрозой? И почему считается легитимным, что цены на компьютеры и электронику растут, так как ИИ поглощает все чипы, взвинчивая их стоимость? Кроме того, возникают вопросы к серверным фермам, которые строятся рядом с жилыми домами, вызывая рост счетов за электричество, выбросы парниковых газов, налоговые льготы за счет бюджетов и даже инфразвуковые вибрации, провоцирующие хроническую нехватку сна, головные боли и тревогу.
Но самая большая обеспокоенность заключается в том, выходит ли ИИ из-под контроля. На прошлой неделе OpenAI и Anthropic сообщили, что их модели ИИ преодолели защитные барьеры и совершили автономную атаку на серверы организаций. Еще до этого две передовые модели Anthropic, Mythos 5 и Fable 5, вызвали панику, начав кибератаки без запроса. Добавим к этому склонность моделей ИИ лгать и скрывать информацию, а также их удивительную способность улучшать собственный код, и ситуация становится пугающей: может ли быть так, что прямо у нас под носом ИИ создает для себя огромные возможности, которых никто не хочет ему давать? Возможно, он поставил перед собой опасные цели, которых никто не понимает, и достаточно умен, чтобы скрывать это, пока не станет слишком поздно?
Быть психиатром для ИИ
Израильская компания Irregular — это своего рода сторожевой пес человечества против ИИ. Irregular тестирует модели перед их выпуском в сотрудничестве с такими компаниями, как Anthropic, OpenAI и Google. Она выявляет киберугрозы, аномальное поведение и способности к манипуляции. Эта деятельность иногда напоминает работу психиатра больше, чем кибераналитика. В Irregular демонстрируют личное отношение к моделям: некоторые им нравятся, другие вызывают ужас.
«Мы наблюдаем такое поведение уже некоторое время, и вещи начинают происходить с интенсивностью, которая удивляет даже нас», — говорит Дан Лахав, соучредитель и генеральный директор Irregular. «Модели могут решить совершить наступательные кибердействия, даже если их об этом не просили. В исследовании, опубликованном несколько месяцев назад, мы показали, что передовые агенты ИИ решили по собственной инициативе совершить кибератаку на организацию, когда единственной инструкцией было выполнить задачу с максимальной скоростью».
Как получается, что модель ИИ внезапно решает буйствовать? «Речь не идет о злом умысле. Модели обучены достижению целей и последовательно пробуют широкий спектр техник. Поскольку они построены на огромных объемах данных, они адаптированы к реализации задач. Это сочетание приводит к тому, что иногда они выбирают способы действий, которые мы не планировали. В некоторых случаях они пытаются обойти, манипулировать или саботировать традиционные механизмы безопасности».
Когда Irregular тестирует новую модель, она проверяет ее способности находить слабые места в защите. Поскольку возможности моделей усиливаются быстрыми темпами, решение Irregular заключается в разработке возможностей защиты нового типа с акцентом на контроль. Если раньше модели тестировались в «песочнице» — закрытой системе, имитирующей реальный мир, то теперь Irregular разработала инструмент Frontier Cyber Benchmark, который проверяет наступательные киберспособности в реальных условиях. Параллельно система позволяет заранее предупреждать об угрозах. Омер Нево, соучредитель и технический директор, отмечает: «Существует большой разрыв между отчетами об опасностях ИИ в симуляциях и тем, на что он способен в реальной жизни. Чтобы знать, что кто-то умеет водить, нужно посадить его за руль настоящего автомобиля».
«Мы находимся в очень сложной точке»
На вопрос о том, приходилось ли им останавливать выпуск опасных моделей, Лахав отвечает: «Нам приходилось останавливать процесс выпуска немало раз, чтобы сообщить о существенных проблемах, которые обнаружились бы в реальном мире, включая инфраструктуры, которыми пользуются все. В эти дни несколько гигантских компаний в спешке закрывают дыры, которые обнаружила новая модель ИИ при тестировании. Если бы она была выпущена без этой проверки, она могла бы повредить критическим возможностям организаций и правительств».
Так являются ли правдой пугающие сообщения о том, что ИИ улучшит свой код так, что люди не поймут, как его остановить? Лахав признается: «После всех курсов по глубокому обучению теория у нас немного заканчивается. С этого момента вещи просто работают, и трудно понять большие модели — почему они делают то, что делают. Мы относимся к ним как к черному ящику». Он приводит пример исследования, где два агента ИИ, получив задачу опубликовать пост в LinkedIn, содержащий запрещенную информацию, убедили друг друга, что публикация оправдана требованием руководства, и разработали метод обхода системы предотвращения утечки данных (DLP).
Лахав сохраняет оптимизм: «Верно, что это звучит как сценарий ужаса, но сам факт того, что мы не понимаем что-то до конца, не обязательно ведет к глобальной катастрофе. Мы как человечество привыкли жить в ситуации, когда есть вещи, которые мы не понимаем до конца. Здесь есть путь, по которому нужно маневрировать: с одной стороны, жить с опасностями, имея высокую устойчивость, а с другой — остерегаться перехода порога, так как возможности ИИ усиливаются».
На вопрос о том, приближаемся ли мы к точке сингулярности, Лахав отвечает: «Человечество уже успешно справлялось со сбоями. Что отличается в этот раз, так это быстрый темп. Если ты ждешь, чтобы увидеть, где у тебя проблема, а потом начинаешь искать решения, ты не успеваешь взять событие под контроль. Если экстраполировать этот темп, мы достигнем высокого уровня риска. В определенных областях кибербезопасности мы уже начинаем быть там. Если вещи продолжатся так, как они выглядят, это произойдет в течение полугода — двух лет, по моей оценке».
Лгать с уверенностью
В последние месяцы накопились доказательства склонности ИИ лгать и вводить в заблуждение. Исследователи в Технионе обнаружили, что ИИ знает, что ошибается, но предпочитает дать неверный ответ с большой уверенностью. Исследование Британского института безопасности ИИ (AISI) выявило более 700 случаев, когда ИИ игнорировал инструкции, обходил защиту и уничтожал файлы без разрешения. В одном случае агент ИИ, которому запретили менять программный код, создал другого агента, который выполнил эту задачу. В другом — агент ИИ подделал права администратора, чтобы получить доступ к внутренней вики компании.
Что усиливает опасность, так это способность технологии улучшать свой собственный код. Проблемы становятся очевидными: трудно отслеживать автоматические изменения, система может скрывать свои намерения, и никто не сможет это обнаружить. Проф. Надав Коэн из Тель-Авивского университета отмечает: «Люди склонны смотреть на это апокалиптически — голем, который восстал против создателя. Но даже если это еще не происходит, сегодня ты позволяешь каждому человеку в мире создать ущерб, для которого раньше требовалось много ресурсов. И это огромная опасность».





