Nvidia, Google и AWS переходят на гетерогенный ИИ: что это значит для индустрии
Индустрия ИИ переходит от обучения моделей к инференсу. Техногиганты Nvidia, Google и AWS внедряют гетерогенные архитектуры со специализированными чипами для снижения стоимости миллиона токенов.

Сдвиг от обучения к инференсу
В последние годы индустрия искусственного интеллекта была почти полностью сосредоточена на обучении: кто построит самую большую модель на самом крупном кластере и быстрее конкурентов. Однако центр тяжести смещается. Модель обучается один раз, а затем обслуживает миллиарды запросов. По мере того как приложения ИИ — такие как чат-боты, ИИ-ассистенты для написания кода и аналитические системы — внедряются в широкий бизнес-оборот, инвестиции в инфраструктуру перетекают от обучения к инференсу (выводу).
Модели рассуждения (Reasoning) и автономные ИИ-агенты лишь ускоряют этот тренд. Каждая задача генерирует длинную цепочку вызовов модели, и потребление токенов при инференсе растет беспрецедентными темпами. Это не просто вопрос объема, но и архитектуры, требующий переосмысления базового вопроса: какой процессор подходит для конкретной задачи.
Решение: специализированные чипы для разных этапов
Легко представить инференс как однородное действие: запрос вошел, ответ вышел. Но на практике это цепочка этапов, принципиально отличающихся друг от друга:
-
Этап Prefill (предобработка): Модель считывает весь входной запрос и выстраивает контекст. Этот процесс требует огромных вычислительных мощностей и по своей природе является параллельным.
-
Этап Decode (декодирование): Токены ответа генерируются последовательно, один за другим. Этот процесс является последовательным, требует колоссального объема памяти и крайне чувствителен к задержкам (latency).
Помимо этого, происходят процессы токенизации, детокенизации и управления KV-кэшем (контекстом, который модель накапливает в ходе диалога). Каждый этап требует своего баланса вычислений, памяти и пропускной способности.
Один процессор, пытающийся быть лучшим на всех этапах, неизбежно идет на компромиссы: дорогая память с высокой пропускной способностью (HBM) простаивает на этапе Prefill, либо огромная вычислительная мощность ожидает отклика памяти на этапе Decode. В эпоху, когда каждый процент эффективности конвертируется в огромные деньги, такие компромиссы становятся неприемлемыми.
Это понимание стремительно воплощается в реальные продукты. AWS уже много лет развивает две отдельные линейки чипов: Trainium для обучения и Inferentia для инференса. Google разделила свои TPU восьмого поколения на TPU 8t (для обучения) и TPU 8i (для инференса). Даже Nvidia представила свой первый LPU, оптимизированный для инференса, наряду с новейшим графическим процессором Rubin GPU.
Это новое направление развития ИИ-индустрии: гетерогенная архитектура со специализированными чипами для разных этапов процесса. Ярким примером является партнерство между AWS и Cerebras: чипы Trainium обрабатывают этап Prefill, системы Cerebras берут на себя Decode, а каждый запрос в процессе инференса передается между процессорами разных производителей.
Вызовы гетерогенного подхода
Гетерогенная архитектура имеет свою цену, которая выражается в двух ключевых проблемах. Первая — это программный слой. Каждое семейство ускорителей работает на своем языке: CUDA от Nvidia, Neuron от AWS и специализированные языки других игроков. Запуск одной модели на разнородной инфраструктуре требует абстрактного слоя для трансляции кода, а также системы оркестрации, способной в реальном времени распределять задачи на наиболее подходящие процессоры.
Второй и самый критический вызов — это сеть. В однородном кластере трафик относительно симметричен и предсказуем. В гетерогенной среде он становится неравномерным: передача контекста (KV-кэша) от процессоров Prefill к процессорам Decode должна происходить на сверхвысокой скорости. Разница в производительности чипов создает резкие всплески трафика, и любой сбой — потеря пакетов или задержка — приводит к простою дорогостоящего оборудования. Поскольку процессы ИИ синхронны по своей природе, система работает со скоростью самого медленного компонента.
Реальный показатель: стоимость миллиона токенов
Как оценить эффективность этих инвестиций? Традиционный показатель TCO (совокупная стоимость владения) обычно рассчитывается исходя из количества процессоров или их вычислительной мощности (FLOPS). Но в мире инференса он может вводить в заблуждение: два кластера с одинаковым числом процессоров могут выдавать абсолютно разное количество токенов из-за сетевых задержек.
Поэтому наиболее актуальным показателем становится CPMT (стоимость миллиона токенов), который соотносит стоимость инфраструктуры с ее реальной производительностью. И здесь гетерогенность побеждает: когда каждый этап выполняется на оптимальном процессоре, стоимость токена резко снижается. Гетерогенный ИИ — это не временный тренд, а неизбежный эволюционный шаг на пути перехода индустрии от обучения моделей к их повсеместному использованию.





