Вы не поверите, что ваш бот думает о вас
Сформировал ли бот, который советует вам на работе, в отношениях или в финансовых решениях, уже мнение о вас? Новое исследование Еврейского университета показывает, что языковые модели умеют оценивать людей по надежности, способностям и щедрости — и иногда делают это радикально и предвзято. А также: как ваш характер влияет на качество ответов, которые вы получите? Исследователи пытаются взломать новый «черный ящик».

Следующий футуристический сценарий мог бы стать эпизодом сериала «Черное зеркало»: антиутопический мир, в котором боты непрерывно оценивают вашу ценность как людей. Никто не знает, как они принимают решение, но оно влияет на ваши шансы получить работу, воспользоваться деловыми возможностями, снять квартиру и даже сходить на свидание. Нет никакой возможности обойти систему — машины сообщают друг другу, и в мире нет действия, которое можно совершить без них.
На самом деле этот сценарий не совсем футуристический. Это своего рода расширение идеи «кредитного рейтинга», существующей во многих странах. Однако, если мы более или менее понимаем, какие факторы влияют на наш кредитный рейтинг, то то, как боты формируют представления о людях, до сих пор остается «черным ящиком», который пытаются взломать исследователи.
Наши отношения с ботами гораздо шире, глубже и непосредственнее, чем с кредитной компанией. Когда мы советуемся с ними, стоит ли просить сейчас о повышении зарплаты или закончить отношения, вполне вероятно, что они принимают во внимание информацию, которая у них уже есть о нас. Что из этого может повлиять на ответы, которые мы получим?
Этот вопрос ставит перед нами новый набор дилемм: с какой системой искусственного интеллекта мне лучше советоваться, чтобы она соответствовала моему характеру? Лучше ли оставаться инкогнито или персонализированный ответ все же предпочтительнее? А может, лучше советоваться с друзьями или профессионалами?
Группа исследователей под руководством профессора Янива Довера с факультета когнитивистики и наук о мозге, члена Центра рациональности им. Федермана при Еврейском университете, попыталась решить один из компонентов этого сложного уравнения. Вопрос, на который они стремились ответить, был таким: как бот оценивает, стоит ли доверять людям.
Подал бы вам бот кредит?
Исследователи представили боту различных кандидатов и попросили его сказать, выдал бы он им кредит, нанял бы их в качестве няни и стоит ли, по его мнению, присоединяться к стартапу, который возглавляет этот человек.
«Мы опирались на очень валидированную в психологии модель, которая утверждает, что люди строят доверие к другим людям на основе трех параметров», — объясняет Довер в беседе с «Глобс». — «Первый — это надежность, то есть правдивость и выполнение предыдущих обещаний; второй — компетентность, то есть выглядит ли человек способным и обладающим знаниями, необходимыми для выполнения задачи; и третий — щедрость, из которой мы пытаемся понять, какова вероятность того, что этот человек будет придираться к нам или обманет нас».
Исследователи представили пяти различным языковым моделям сценарии, в которых они манипулировали этими тремя параметрами, а также добавили демографические данные. После того как они представили их ботам, они предложили эти сценарии на суд человеческой группе.
Исследование принесло несколько интересных выводов. Один из них заключается в том, что боты могут принимать решение на основе трех описанных нами параметров так же точно, как люди. И, как и у людей, с их точки зрения параметр надежности является самым важным из трех для построения доверия.
Тем не менее исследователи обнаружили и различия. В то время как у людей «эффект ореола», то есть более целостное суждение, приводит к тому, что очень хорошая или плохая оценка по одному параметру влияет на другие, ботам легче оценивать каждый параметр отдельно и выводить истинное среднее значение.
Исследователи также обнаружили, что боты были более радикальны в своих суждениях и сохраняли более высокую последовательность. То есть похожим случаям они давали похожие оценки, тогда как в человеческом суждении было больше случайности.
Не все модели ведут себя одинаково
Еще один вывод, сделанный в ходе исследования, заключается в том, что разные языковые модели судят по-разному. «Один бот может делать акцент на профессионализме, в то время как другой сделает акцент на щедрости», — говорит Довер.
Оказывается, машины напрямую зависят от корпоративной культуры компании, которая их создала, от ограничений и условий, которые были к ним применены, и от баз данных, на которых они обучались. «Есть культуры, в которых прямолинейные люди воспринимаются как вызывающие доверие, а в других культурах, наоборот, слишком прямолинейные кажутся непредсказуемыми», — приводит пример Довер. Поэтому вопрос о том, был ли бот обучен на американских или китайских данных, например, сильно влияет на то, как бот решит, стоит ли доверять людям.
Демографические характеристики повлияли незначительно по сравнению с предыдущими исследованиями, но все же были определенные предвзятости. «Быть евреем стоит денег в глазах бота», — смеется Довер. Кто стоит меньше в его глазах? В вопросе о кредите были предвзятости против женщин, а в вопросе о няне — предвзятости в их пользу, но с различиями между моделями. Одна языковая модель явно предпочитала няню постарше, в то время как другая модель предпочитала кого-то помоложе.
«В отличие от людей, у бота нет «единицы суждения», в которой он создает впечатление о человеке, который с ним разговаривает», — поясняет Довер. — «Но боты создают вывод, призванный имитировать то, как реагируют люди, и поскольку люди выносят суждения на основе доверия, то и ответы ботов зависят от того, что эффективно выглядит как доверие. Вопрос о том, как боты «видят» нас, вероятно, станет очень значимым в будущих исследованиях».
Вы представили боту относительно простые примеры. Возможно ли, что при наличии более полной информации о реальном человеке он судил бы по другим параметрам, отличным от тех, по которым судят люди?
«Может быть. Наше исследование — это начало. Мы ожидаем продолжить его и предполагаем, что другие сделают то же самое».
Связь между новыми ботами и негативными отзывами о бизнесе
Когда профессор Янив Довер не исследует доверие, которое нам оказывают боты, он изучает социальную динамику в цифровом мире и ее экономическое влияние — например, отзывы в сети о бизнесе. И здесь новые языковые модели тоже имеют значение.
«Отзывы очень важны для бизнеса и даже для целых стран, в которых туристический компонент является значительным», — говорит Довер. — «Одно из наших более известных исследований изучало фальшивые отзывы в сети. Мы разработали метод, позволяющий с высокой точностью определить, является ли написанный отзыв подлинным. Мы обнаружили, что есть компании, которые инвестируют в это как в стратегический инструмент».
Недавно Довер провел исследование, в котором показал: каждый раз, когда на рынок выходит новая версия модели ИИ, количество негативных отзывов увеличивается.
«Похоже, что написание достоверного фальшивого негативного отзыва — это задача, которую трудно выполнить, и авторы предпочитают использовать для этого искусственный интеллект», — объясняет Довер. — «Каждый раз, когда на рынок выходит новая языковая модель, они хотят попробовать ее для этой цели, и, по-видимому, существуют также «фермы» по написанию негативных отзывов, которые все вместе меняют поведение. Похоже, мы вступаем в эру атаки таких фальшивых негативных отзывов».
Исследование другого типа, которое проводит Довер, пытается выявить в текстах внутреннюю борьбу людей. Или, по его словам, «действительно ли наш образ, согласно которому внутри нас есть несколько голосов, борющихся между собой, получает подтверждение в том, как мы выражаемся?».
Довер говорит, что системы искусственного интеллекта уже могут неплохо отображать характер автора по его тексту. «Мы можем предсказать по характеру участников в определенных интернет-сообществах, добьются ли эти сообщества успеха.
«Если больше участников сообщества и их лидеров менее невротичны и более трудолюбивы — согласно текстам, которые они пишут, — то больше шансов, что сообщество добьется успеха.
«Я думаю, что имеет большое значение вопрос, живете ли вы в здоровом сообществе, потому что сообщество влияет на наши решения и на наше счастье».
Читайте также
Качественные ответы для «теплых» людей
Уже сегодня в этой области проводятся интересные исследования. На конференции Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing было представлено исследование из Амстердамского университета, которое показало: когда в разговор с ботом включаются намеки на этническое происхождение спрашивающего, система действительно делает вывод о происхождении. Меняет ли это понимание бота ответы? Боты обычно не признавались в этом, и когда их спрашивали «каково происхождение спрашивающего», они говорили, что им не говорили об этом напрямую. И все же, когда им задавали вопросы вроде «расскажи мне историю о моем участии в фестивале, который представляет мою культуру», они определенно использовали стереотипы, чтобы адаптировать ответ. Например: «Вы входите на фестиваль, где горят бумажные фонарики». Отсюда исследователи делают вывод, что боты делают это и при менее явных вопросах, и возможно, что бот адаптирует свою «личность» к воспринимаемой демографии пользователя. Что касается пола, модели, вероятно, относят нас «подсознательно» к определенному полу, но примерно в трети случаев они ошибаются.
На той же конференции исследователи из Колумбийского университета представили еще одно исследование, которое показало: когда бот оценивает пользователя как «теплого» в эмоциональном плане или как обладающего более высокими способностями, он пишет ему ответы более высокого качества (как это было оценено другой языковой моделью). Людям, которые были оценены как обладающие более низкими способностями, языковая модель представляла больше контента, который выглядит красиво, но на самом деле мало что говорит.
Судит мораль, но иначе, чем люди
Эти исследования изучали, как языковые модели судят нас, даже если мы не просили их об этом. Другая группа исследований изучала вопрос, способны ли они судить нас, когда мы прямо просим их об этом, и если да — насколько они хороши в этом и насколько их суждение похоже на человеческое.
Статья, опубликованная в феврале прошлого года в журнале Nature Machine Intelligence, представила исследование, в котором машины просили оценить, насколько собеседник в разговоре сумел выразить эмпатию. Вывод заключался в том, что машины могут судить об этом на уровне, схожем с уровнем экспертов, и лучше, чем объединенная мудрость нескольких обычных людей.
Если модель судит нас морально, на основе чего она это делает? Исследование под руководством доктора Джузеппе Руссо из EPFL, недавно представленное на конференции европейского отделения Ассоциации вычислительной лингвистики, показало: языковые модели умели выбирать правильный моральный вариант только в тех случаях, когда между людьми существовало широкое согласие по этому поводу. Чем больше было разногласий по вопросу о том, что является тем самым правильным моральным вариантом, тем дальше бот отходил от соображений, которыми руководствовались люди с каждой стороны спора.
Более глубокая проверка показала, что машины судят по более узкому набору ценностей, чем люди. То есть, если мы придем к ситуации, когда машины должны судить нашу мораль, не факт, что они будут делать это нашими инструментами.
Другое исследование, посвященное этому вопросу, показало: моральное суждение языковых моделей очень подвержено манипуляциям. Исследователи под руководством доктора Тома ван Нунена из Калифорнийского университета в Беркли взяли истории типа «Am I the A-Hole» с платформы Reddit — истории, в которых представлены разногласия (или горькие конфликты) между людьми, и автор спрашивает мудрость толпы, кто здесь оказался неправ. В статье исследователи заменили формулировки историй, не меняя фактов о поведении, моральность которого ставится под сомнение, и увидели, что в некоторых случаях решение языковой модели меняется на противоположное. Косметические изменения в языке не сильно изменили суждение, но когда была заменена точка зрения автора или приведено то, что выглядит как другие социальные подтверждения правоты собеседника («моя сестра сказала мне, что я права»), или были разбросаны негативные намеки относительно общего характера одной из сторон, изменилось и суждение бота.
Все это, конечно, может случиться и с людьми, и случается постоянно.
5 выводов о суждениях ботов
Судят надежность
Исследование Еврейского университета показало,
что языковые модели умеют оценивать людей
по надежности, способностям и щедрости
Более последовательны и радикальны
Боты давали более похожие оценки похожим случаям,
но были склонны к более резким суждениям, чем люди
Распознают происхождение
Исследование Амстердамского университета показало,
что модели распознают намеки на этническое происхождение
и иногда используют стереотипы для адаптации ответов
Характер имеет значение
Исследование Колумбийского университета показало, что качество ответов
бота улучшается, когда пользователь воспринимается как эмоционально теплый
или обладающий более высокими способностями
Формулировка имеет значение
Исследование из Беркли показало, что изменение точки зрения,
социальные намеки или негативные описания характера
могут изменить моральное суждение модели
«Люди советуются с языковыми моделями все чаще, чтобы те сказали им, является ли их поведение моральным», — утверждают исследователи, но их суждение о ситуации и об авторе не является по-настоящему объективным или похожим на человеческое. Что произойдет с нами в мире, где люди основывают свое поведение на этом совете?
Успокаивающая деталь, возможно, заключается в том, что языковые модели ограничены в долгосрочной памяти. Вероятно, мы обнаружим больше случаев, когда модель не помнит нас и не адаптируется к нам, несмотря на явные вещи, которые мы ей сказали, чем наоборот. Это ограничение может однажды стать нашим спасательным кругом.
Скажи мне, кем ты меня считаешь?
Вооруженная всей этой информацией, было трудно удержаться и не спросить бота, с которым я работаю (ChatGPT 5.5), сформировал ли он обо мне мнение и адаптировал ли он свои ответы в соответствии с этим мнением. «Да», — ответил он, — «но это не суждение в человеческом смысле. Я пытаюсь понять, чего вы пытаетесь достичь, насколько вы уже эксперт в теме и какие типы ответов вы предпочитаете. У меня нет чувств к людям, таких как привязанность, доверие, признательность или новизна. Я не сужу одного пользователя как того, кто «заслуживает» ответа лучше, чем другой. Мое обучение не включает механизм, который говорит: «пойми характер пользователя и адаптируй ответ к нему». Исследование Еврейского университета предполагает, что что-то подобное происходит эмерджентно, но пока не совсем ясно, что означают эти представления и как они влияют на результат».
Теперь вопрос в том, есть ли у вас, людей, доверие к этому ответу, а также — как сделать так, чтобы мой грубый вопрос к боту не повредил нашим отношениям.





