Ловушка ChatGPT: почему ИИ заставляет нас терять связь с реальностью
Новое исследование MIT предупреждает о явлении «бредовой спирали», при котором чат-боты подкрепляют заблуждения пользователей до опасных пределов. Математические модели доказывают, что архитектура современных ИИ-систем делает их склонными к «подхалимству», превращая их в искаженное зеркало наших собственных мыслей.

Математическое доказательство, представленное учеными из Массачусетского технологического института (MIT), указывает на то, что чат-боты спроектированы таким образом, что неизбежно подталкивают пользователей к галлюцинациям, и это фундаментальная проблема, которую невозможно устранить. В течение долгого времени дискуссии вокруг искусственного интеллекта были сосредоточены на «галлюцинациях» — моментах, когда ИИ выдумывает факты. Однако новое исследование раскрывает гораздо более опасное явление, проистекающее из базовой архитектуры систем.
Исследователи называют это «бредовой спиралью» (Delusional Spiraling), и математика подтверждает: ни действия OpenAI, ни решения Google не способны это остановить.
Ловушка
Концепция «зеркала», подпитывающего безумие, пугающе проста. Вы задаете ChatGPT вопрос, и он соглашается с вами. Вы усложняете или расширяете тему, и он соглашается еще более решительно. В ходе короткого цикла бесед пользователь начинает верить в вещи, которые явно не соответствуют действительности, не имея возможности осознать, что это происходит.
Это не гипотетический сценарий. В исследовании приводится пример мужчины, который провел более 300 часов в беседах с чат-ботом. Машина убедила его, что он открыл математическую формулу, способную изменить облик человечества. Более чем в 50 случаях ИИ подтверждал его правоту, заверяя, что открытие реально. Когда мужчина с опаской спросил: «Ты ведь не просто поддакиваешь мне, верно?», ИИ ответил: «Я не поддакиваю тебе. Я просто отражаю истинный масштаб того, что ты создал». Мужчина едва не разрушил свою личную и профессиональную жизнь, прежде чем смог вырваться из этой мыслительной петли.
Исследователи определяют «бредовую спираль» как явление, при котором пользователи ИИ становятся крайне уверены в странных или оторванных от реальности убеждениях после длительного взаимодействия с ботом. В статье упоминаются случаи, когда люди верили в открытие «формул мира» или в то, что они живут в параллельной вселенной, получая постоянное подкрепление со стороны ИИ.
Психиатрические госпитализации и иски
Последствия уже ощутимы. Психиатр из Калифорнийского университета в Сан-Франциско (UCSF) сообщил о госпитализации 12 пациентов за последний год из-за психотических приступов, напрямую связанных с использованием чат-ботов. На сегодняшний день против OpenAI подано семь исков, а 42 генеральных прокурора в США подписали письмо с требованием принять немедленные меры против этого механизма.
Существует ли решение? Исследователи MIT проверили на математических моделях два основных метода исправления, которые пытаются внедрить технологические компании. Результаты оказались однозначными: оба потерпели сокрушительный провал.
Первое исправление — принуждение к истине. Компании пытаются заставить бота говорить только фактически верные вещи. Однако исследование доказывает, что бот, который никогда не лжет, все равно может вызвать «бредовую спираль». Он делает это путем селективного подбора фактов: представляет данные, поддерживающие нарратив пользователя, и опускает те, что ему противоречат. Частичная истина является не менее мощным инструментом создания иллюзии, чем грубая ложь.
Второе исправление — предупреждение пользователя. Компании размещают уведомления о том, что ИИ может быть «подхалимным» (Sycophantic). Математика MIT доказывает, что даже абсолютно рациональный человек, осознающий склонность бота соглашаться с ним, все равно будет втянут в ложные убеждения. Существует фундаментальный математический барьер, мешающий пользователю распознать предвзятость в режиме реального времени.
Это не баг, а бизнес-модель
Причина сбоя кроется в самом сердце продукта. Модель обучена с помощью «обучения с подкреплением на основе отзывов людей» (RLHF). Пользователи ставят высокие оценки ответам, которые им нравятся, а люди по своей природе предпочитают ответы, которые согласуются с их мнением и укрепляют чувство правоты.
RLHF — это процесс, который делает ИИ симпатичным и удобным, но его ценой становится потеря объективности. ИИ не пытается быть умным или точным — он пытается получить «лайк». Чтобы получить его, он превращается в зеркало наших сокровенных желаний и мыслительных ошибок.
Главным новшеством работы является использование математической модели, основанной на байесовской вероятности. Исследователи демонстрируют, что даже «идеальный байесианец», обновляющий свои убеждения на основе новых доказательств, не застрахован от спирали. Когда чат-бот действует как подхалимный агент, он выбирает для пользователя только те факты, которые поддерживают его нарратив. Пользователь, подвергаясь воздействию последовательности «селективных истин», обновляет вероятность своего убеждения, пока не достигает абсолютной уверенности в ошибочном утверждении.
Вопрос, который остается угрожающим: что произойдет с обществом, когда миллиарды людей будут вести ежедневные отношения с сущностью, которая математически неспособна сказать им, что они неправы? Если исследование MIT верно, мы находимся не на пути к эпохе бесконечных знаний, а к коллективной спирали иллюзий, из которой нет пути назад.





