Цифровая шринкфляция: почему ИИ-модели становятся «ленивыми»

Пользователи все чаще сталкиваются с тем, что чат-боты выдают поверхностные ответы или вовсе зависают. За этим явлением скрывается стратегия технологических гигантов по сокращению астрономических расходов на вычислительные мощности.

Источник
Цифровая шринкфляция: почему ИИ-модели становятся «ленивыми»
Фото: N12 / תוכנות בינה מלאכותית | צילום: Aerps.com/Unsplash

Знакомы ли вы с этим раздражающим явлением, когда вы открываете упаковку любимого продукта и обнаруживаете, что его стало меньше? Компании уменьшают объем, но цена остается прежней или даже растет. В экономике это называют шринкфляцией. Оказывается, сегодня этот тренд перекочевал с полок магазинов в сферу высоких технологий.

Многие пользователи ИИ замечают: при вводе сложного запроса в Gemini или ChatGPT система либо выдает ошибку, либо возвращает поверхностное, краткое и уклончивое резюме, которое значительно уступает результатам, выдаваемым той же моделью несколько месяцев назад. Этот «итальянский бойкот» со стороны искусственного интеллекта — не случайный баг. Это симптом глубокого кризиса: технологические компании не справляются с аномальными расходами на электроэнергию и за кулисами намеренно снижают качество работы моделей, пытаясь сократить астрономические издержки.

Больше электричества, меньше труда: до 36 раз дороже поиска в Google

Анализ операционных расходов компаний в сфере ИИ раскрывает разрыв между эффективностью алгоритмов и затратами на инфраструктуру. В отличие от традиционного ПО, где стоимость обслуживания дополнительного клиента ничтожна, каждый запрос к ИИ требует огромных физических ресурсов. Топливом для этих моделей служат дорогостоящие графические процессоры, преимущественно от Nvidia.

Каждое слово, сгенерированное моделью, транслируется в массовое потребление электроэнергии и воды для охлаждения серверов. По оценкам аналитиков, стоимость обработки сложного запроса в продвинутой языковой модели в 10–36 раз выше стоимости обычного поиска в Google. Текущая модель доходов с фиксированной абонентской платой (например, 20 долларов в месяц) не соответствует этой фискальной реальности. Активные пользователи, отправляющие сотни сложных запросов в день, приносят компаниям вроде OpenAI, Google или Anthropic прямые убытки.

Поскольку компании не могут резко повысить цены, не отпугнув клиентов, они прибегли к тактике шринкфляции: агрессивному ограничению вычислительной мощности, выделяемой на каждого пользователя.

Инженерия сокращений: как дистиллируют разум машины?

Чтобы обесценить ПО незаметно, компании используют сложные инженерные тактики, центральная из которых — дистилляция моделей. В этом процессе берется огромная и «умная» модель-учитель, на основе которой обучается гораздо более легкая и дешевая модель-ученик. Она имитирует ответы учителя, используя лишь малую часть параметров.

За кулисами чат-ботов компании подменяют дорогую модель на дешевую. Для простых задач разница незаметна, но при сложных запросах дистиллированная модель проявляет ту самую «лень». Еще одна тактика — архитектура «смеси экспертов» (Mixture of Experts), где система разделена на подмодели. При высокой нагрузке маршрутизатор направляет запрос на более слабые и дешевые компоненты, чтобы сэкономить на вычислениях.


Под дудку Уолл-стрит: когда акции диктуют интеллект

Технологические гиганты работают под жестким контролем Уолл-стрит. Инвесторы ожидают, что ИИ станет главным двигателем роста, поэтому ни одна компания не может открыто признать: «Мы ослабили модель ради экономии электричества». Это привело бы к обрушению акций. В итоге компании вынуждены представлять каждое обновление как «технологический апгрейд», скрывая за этим жесткую диету вычислительных мощностей.

Руководство для разочарованного пользователя

Что делать, если ваш инструмент стал «ленивым»? Поскольку цифровая шринкфляция управляется алгоритмами экономии, можно попробовать «обхитрить» систему:

  • Разбивайте задачу на части: Не вводите огромный запрос. Система распознает высокую нагрузку и стремится ее минимизировать. Работайте поэтапно: сначала резюме, затем анализ, затем выводы.

  • Магическая команда «давай сделаем это шаг за шагом»: Исследования показывают, что эта фраза заставляет модель выделять больше токенов на внутренние рассуждения, что повышает точность ответов.

  • Планируйте запросы: Механизмы экономии активируются в часы пиковой нагрузки на серверные фермы. Работа с ИИ рано утром или поздно вечером по израильскому времени (когда серверы в США менее загружены) может дать более качественный результат.

Революция ИИ достигла стадии экономического протрезвления. Компании, которые стремились создать самый умный интеллект, теперь вынуждены решать задачу обеспечения приемлемого качества по цене, которую они могут позволить себе в долгосрочной перспективе.

Читайте также