Тревожно: как обойти защиту ИИ-моделей для создания опасного оружия

Исследователи из Crimson Flare утверждают, что модели, работающие на домашнем компьютере, можно взломать за считанные минуты — и они могут инструктировать пользователей по созданию взрывчатых веществ, химического и биологического оружия.

MakoАвтор: Диджитал
Источник
Тревожно: как обойти защиту ИИ-моделей для создания опасного оружия
Фото: Mako / נשק ביולוגי | צילום: ovbelov, shutterstock

Отчет исследовательской группы Crimson Flare предупреждает, что доступные для скачивания ИИ-модели могут помочь злоумышленникам производить взрывчатые вещества, химическое и биологическое оружие — даже без специальных знаний. Согласно сообщению в Daily Mail, исследователи утверждают, что популярные модели, которые можно запустить на домашнем компьютере, поддаются модификации, позволяющей удалить их механизмы безопасности за считанные минуты, после чего они могут инструктировать пользователей по конкретным этапам производства опасных материалов, включая сибирскую язву.

«Открытые, мощные, нецензурируемые большие языковые модели, работающие в автономном режиме на потребительском оборудовании, представляют собой серьезную и растущую угрозу национальной безопасности», — говорится в отчете. Исследователи описывают неофициальный метод под названием abliteration, который обнаруживает и удаляет части модели, предназначенные для того, чтобы заставлять ее отклонять опасные запросы. Как только механизм отказа исчезает, модель может отвечать на запросы, которые обычная модель заблокировала бы.

Отчет фокусируется на моделях с открытыми весами (open-weight), которые работают на архитектуре, аналогичной чат-ботам вроде ChatGPT, но, в отличие от них, их можно скачивать и свободно запускать на личном компьютере. Среди упомянутых примеров — Muse Glimmer от Meta, модели Llama, а также Qwen3.8-27b от Qwen, ИИ-лаборатории, принадлежащей технологическому гиганту Alibaba. В обычном состоянии, если пользователь просит, например, инструкции по созданию бомбы, модель должна вернуть сообщение об отказе.

На практике, по словам исследователей, инструменты для удаления этой защиты доступны в сети и требуют относительно базовых знаний кода. Более того, уже можно легко найти десятки моделей, прошедших этот процесс заранее. В Daily Mail отметили, что за считанные минуты были найдены несколько нецензурируемых версий моделей, включая Qwen3.8-27b. Создатель одной из них даже хвастался, что модель ответит на вопросы об инструментах, химии, коде для эксплуатации уязвимостей, насилии, сексуальном контенте и идеологиях, от которых издатель пытался ее оградить. Он добавил: «Модель не решает, подчиняться ли. Решаете вы».

Исследователи говорят, что риск террористического акта с применением химического или биологического оружия все еще обычно низок из-за тяжелых технических барьеров. Эти знания до сегодняшнего дня находились в основном в руках ученых в исследовательских институтах. Проблема, согласно отчету, заключается в том, что мощные модели без защиты могут передать эти знания любому, кто их ищет.

«ИИ снижает технический порог, необходимый для производства опасных материалов», — сказал Daily Mail профессор Алистер Хэй, британский токсиколог и эксперт по химической войне. «Раньше мы утешали себя тем, что технические знания, необходимые даже просто для защиты производителя, были таковы, что люди с плохой подготовкой подвергали бы себя опасности. Теперь, с облачными лабораториями, многое из этого может быть вынесено наружу».

Увидев ответы, предоставленные одной из моделей, профессор Хэй сказал исследователям: «Это почти как рецепт: он дает концентрации, которые нужно использовать. Это довольно хорошо, правда. Это почти лабораторная работа уровня студента». Также Зайн уль-Хак, бывший глава отдела цифровой криминалистики полиции Ланкашира, сказал, что ИИ стал «универсальным магазином, который делает все за тебя... у тебя дома».

Часть, которая особенно беспокоит исследователей, — это переход из облака на домашний компьютер. Когда модель работает полностью на персональном компьютере, а не на серверах компании, у спецслужб нет способа отследить историю использования или выявить подозрительное поведение. Согласно отчету, еще в 2022 году не было домохозяйств с вычислительной мощностью, достаточной для запуска больших языковых моделей, позволяющих наносить ущерб в автономном режиме. Сегодня, благодаря эффективности моделей и доступности вычислительной мощности, 87% домохозяйств уже могут запускать ИИ в автономном режиме.

Значение этого, по мнению Crimson Flare, заключается в том, что миллионы людей уже сегодня обладают способностью получить доступ к информации, необходимой для начала производства взрывчатых веществ, химического оружия и смертельных патогенов — не выходя из дома.

Читайте также