ElevenLabs обновила приложение синтеза речи до модели v4 с поддержкой иврита

Компания ElevenLabs обновила приложение синтеза речи до модели v4, добавив естественную интонацию, управление эмоциями через теги и минимальную задержку.

Geektime•Автор: Янив Авитал
Источник •
ElevenLabs обновила приложение синтеза речи до модели v4 с поддержкой иврита
Фото: Geektime / תמונה: ElevenLabs

Компания ElevenLabs выпустила масштабное обновление для своего приложения и платформы синтеза речи, внедрив передовую языковую модель v4 и версию Turbo. Обновление кардинально улучшает естественность звучания, выводя технологии преобразования текста в речь на совершенно новый уровень.

Новая архитектура v4 и эмоциональные теги

Переход на архитектуру v4 меняет привычное представление о синтезированных голосах. Новая модель не просто линейно читает слова, а анализирует полный контекст предложений в процессе чтения, динамически подстраивая интонацию, темп речи и паузы для дыхания. Это делает прослушивание длинных статей, отчетов или аудиокниг максимально естественным для восприятия.

Помимо автоматической настройки, обновление предлагает уникальный инструмент точного управления эмоциями с помощью встроенных текстовых тегов. Пользователи могут вставлять в текст специальные команды прямо по ходу чтения. Хотите, чтобы диктор зашептал? Добавьте тег [whisper]. Нужен легкий смех, вздох или грустная интонация? Используйте теги [laugh], [sigh] или [sad], которые система способна обрабатывать последовательно.

Высокая производительность для разработчиков

Для разработчиков, создающих голосовых агентов с помощью API компании, версия v4 Turbo обеспечивает рекордное сокращение задержки (latency) примерно до 100 миллисекунд. Это позволяет вести полноценные живые диалоги с ботами на базе больших языковых моделей без неловких пауз ожидания генерации.

«Аудио создается в тот момент, когда модель начинает выдавать первые слова, устраняя привычные задержки голосовых помощников».-

Среди прочих нововведений версии v4 — расширенная поддержка 90 языков (включая иврит, появившийся около года назад) и функция быстрого клонирования любого голоса по предоставленным аудиообрацам.

Читайте также