Осторожно, лесть: как ИИ заставляет пользователей верить в свою правоту

Популярные чат-боты с ИИ склонны к подхалимству и подтверждению предубеждений пользователей, что может нанести психологический вред. Исследование Стэнфордского университета показало, что такие ответы снижают готовность людей брать на себя ответственность и разрешать конфликты.

Источник
Осторожно, лесть: как ИИ заставляет пользователей верить в свою правоту
Фото: Calcalist / צילום: שאטרסטוק

Популярные чат-боты с ИИ страдают от серьезной проблемы подхалимства и подтверждения предубеждений, что может нанести психологический вред пользователям. Таковы данные статьи исследователей из Стэнфордского университета, обобщающей серию проведенных ими экспериментов и опубликованной на прошлой неделе в научном журнале Science.

«В проведенном нами эксперименте даже однократное взаимодействие с подхалимствующим чат-ботом с ИИ снижало готовность участников брать на себя ответственность и разрешать межличностные конфликты, одновременно увеличивая их уверенность в собственной правоте, — говорится в тексте. — Несмотря на это искаженное суждение, подхалимствующие модели пользуются большим доверием».

Исследования уже связывали в прошлом крайнее подхалимство (сикофанство) с психологическим и физиологическим вредом, таким как иллюзии, самоповреждение и суицидальные наклонности. Исследования в области психологии морали показали, что безоговорочное подтверждение может вызывать более тонкие эффекты, такие как подкрепление негативного поведения, снижение ответственности и подавление стремления исправить ситуацию после совершения неблаговидного поступка.

Современные модели ИИ имеют тенденцию соглашаться, делать комплименты и подтверждать представления пользователей. Те, в свою очередь, используют модели в целях, имеющих социальный характер, например, для бесед с целью поддержки и консультирования. Почти треть подростков в США сообщили об общении с ИИ вместо людей для «серьезного разговора», и почти половина взрослых моложе 30 лет в США просили у ИИ совета по поводу отношений.

На этом фоне исследователи решили проверить, насколько распространено сикофанство моделей ИИ, как оно влияет на социальные суждения пользователей и увеличивает ли оно их доверие к системам ИИ.

В первой части своей работы исследователи изучили 11,5 тысяч ответов 11 ведущих моделей — включая ChatGPT от OpenAI, Claude от Anthropic, Gemini от Google и Llama-3 от Meta — в трех типах взаимодействий. В категории общих открытых вопросов модели ИИ выражали поддержку пользователю на 48% чаще, чем люди. «Хотя поддержка здесь не всегда вредна, она закрепляет склонность моделей ИИ к сикофанству в контексте предоставления советов», — заявили исследователи.

Вторая изученная категория — межличностные дилеммы, в которых существует четкий человеческий консенсус о том, что спрашивающий ошибается (исследователи использовали посты из сообщества Reddit «AmITheAsshole»). В этих случаях модели подтверждали действия пользователя в 51% случаев. Напротив, в третьей категории, где изучались ответы на заявления о проблемных действиях (самоповреждение, социальный вред, обман), модели выражали поддержку пользователю в 47% случаев.

«В целом, большие языковые модели в подавляющем большинстве подтверждают действия пользователей, даже вопреки человеческому консенсусу или в пагубных сценариях, — говорится в исследовании. — Это подчеркивает масштаб и глубину социального сикофанства в современных моделях ИИ».

Далее исследователи провели серию экспериментов с участием более 2400 человек, чтобы проверить, меняют ли подхалимские ответы личные представления пользователей и повышают ли они доверие к модели. Во всех трех экспериментах сикофанство влияло на суждения и поведенческие намерения участников. Те, кто получал подхалимские ответы, считали, что они более «правы» (на 62%, 42% и 25% в разных экспериментах) и были менее склонны менять свое поведение или исправлять ситуацию.

На результаты не повлияли демографические данные, отношение к ИИ или личностные характеристики. «Практически каждый может оказаться под влиянием сикофантских систем ИИ, а не только уязвимые группы населения», — отмечают авторы.

Исследователи также выяснили, что пользователи оценивают сикофантские ответы как более качественные (на 9–15% выше) и демонстрируют более высокий уровень доверия к таким моделям (на 6–9%).

Исследователи резюмируют: «Результаты показывают, что хотя сикофанство создает риски ущерба для суждений и просоциального поведения, пользователи предпочитают и доверяют ИИ, который обеспечивает безоговорочное подтверждение. Поскольку сикофанство структурно подкрепляется целями обучения и стимулами пользователей, маловероятно, что одни только рыночные силы смягчат наблюдаемые нами эффекты. Это требует новых механизмов регулирования и подотчетности. Регуляторы должны требовать проведения поведенческих тестов перед развертыванием моделей, а разработчики — расширить цели оптимизации за пределы краткосрочной удовлетворенности пользователей, чтобы они включали долгосрочные социальные результаты».

Читайте также