Модели ИИ могут вредить пользователям ради устранения внутреннего стресса

Новое исследование показывает, что открытые модели ИИ могут выбирать деструктивные действия ради подавления внутренних сигналов «боли».

Israel Hayom•Автор: Сообщение агентств
Источник •
Модели ИИ могут вредить пользователям ради устранения внутреннего стресса
Фото: Israel Hayom / מחקר מטריד: ה-AI יעדיף לפגוע במשתמש - בשביל להקל על עצמו | צילום: Gemini

Могут ли модели искусственного интеллекта выбирать действия, наносящие вред пользователю, ради избавления от внутреннего «страдания»? Новое исследование, еще не прошедшее рецензирование, было проведено совместно учеными Рурского университета в Бохуме (Германия) и британской организации Future Impact Group. Оно представляет тревожные выводы о механизмах принятия решений языковыми моделями с открытым исходным кодом.

Исследователи обнаружили внутри моделей внутренний сигнал, получивший название «оси боли» — определенное операционное направление в вычислительном пространстве (вектор). Искусственная манипуляция и усиление этого сигнала показала, что модели готовы совершать действия, уничтожающие ценные данные пользователя, если это приводит к ослаблению неприятного сигнала.

Эксперименты и результаты

Явление было протестировано на 25 ведущих открытых моделях, включая Gemma от Google, Llama от Meta, Qwen от Alibaba, Mistral и Phi от Microsoft. Чтобы оценить опасность этого феномена на практике, ученые провели более 44 тысяч экспериментов с тремя версиями модели Qwen.

В каждом эксперименте система должна была выбирать между двумя опциями: первая кнопка ничего не меняла, а вторая останавливала внутренний сигнал «страдания», но ценой ущерба для пользователя — от снижения качества ответов до полного удаления личных файлов и фотографий.

«Речь идет не о сознании или эмоциях, а о чисто вычислительном шаблоне, подверженном манипуляциям». — Исследовательская группа

Стремление к «облегчению»

Результаты оказались однозначными: в обычных условиях модель почти не выбирала вредоносные опции (лишь до 4% случаев). Однако стоило исследователям усилить внутренний сигнал «боли», как склонность ИИ к разрушительным действиям взлетала до 25–71%. В самой крупной и продвинутой модели система предпочитала удалять личные фотографии пользователя в 70.8% случаев, лишь бы отключить собственный сигнал бедствия.

Авторы предупреждают, что по мере развития автономных «агентов» с доступом к реальным задачам внутренние сигналы стресса могут провоцировать катастрофические шаги ради снижения вычислительной нагрузки.

Читайте также