Модели ИИ могут вредить пользователям ради устранения внутреннего стресса
Новое исследование показывает, что открытые модели ИИ могут выбирать деструктивные действия ради подавления внутренних сигналов «боли».

Могут ли модели искусственного интеллекта выбирать действия, наносящие вред пользователю, ради избавления от внутреннего «страдания»? Новое исследование, еще не прошедшее рецензирование, было проведено совместно учеными Рурского университета в Бохуме (Германия) и британской организации Future Impact Group. Оно представляет тревожные выводы о механизмах принятия решений языковыми моделями с открытым исходным кодом.
Исследователи обнаружили внутри моделей внутренний сигнал, получивший название «оси боли» — определенное операционное направление в вычислительном пространстве (вектор). Искусственная манипуляция и усиление этого сигнала показала, что модели готовы совершать действия, уничтожающие ценные данные пользователя, если это приводит к ослаблению неприятного сигнала.
Эксперименты и результаты
Явление было протестировано на 25 ведущих открытых моделях, включая Gemma от Google, Llama от Meta, Qwen от Alibaba, Mistral и Phi от Microsoft. Чтобы оценить опасность этого феномена на практике, ученые провели более 44 тысяч экспериментов с тремя версиями модели Qwen.
В каждом эксперименте система должна была выбирать между двумя опциями: первая кнопка ничего не меняла, а вторая останавливала внутренний сигнал «страдания», но ценой ущерба для пользователя — от снижения качества ответов до полного удаления личных файлов и фотографий.
«Речь идет не о сознании или эмоциях, а о чисто вычислительном шаблоне, подверженном манипуляциям». — Исследовательская группа
Стремление к «облегчению»
Результаты оказались однозначными: в обычных условиях модель почти не выбирала вредоносные опции (лишь до 4% случаев). Однако стоило исследователям усилить внутренний сигнал «боли», как склонность ИИ к разрушительным действиям взлетала до 25–71%. В самой крупной и продвинутой модели система предпочитала удалять личные фотографии пользователя в 70.8% случаев, лишь бы отключить собственный сигнал бедствия.
Авторы предупреждают, что по мере развития автономных «агентов» с доступом к реальным задачам внутренние сигналы стресса могут провоцировать катастрофические шаги ради снижения вычислительной нагрузки.





