Разработка ИИ-агента для самых чувствительных жизненных моментов
Разработчики компании Empathy делятся архитектурным опытом создания голосового агента на базе ИИ для репетиции сложных и эмоционально чувствительных разговоров.

Генеративные языковые модели (LLM) разрушают базовое предположение о том, что разработчики полностью контролируют любой вывод системы. Компания Empathy разработала голосового агента, призванного помочь пользователям подготовиться к сложным разговорам с близкими — например, обсуждению составления завещаний, доверенностей и планов на случай потери трудоспособности. Хотя оформление документов является важным шагом, последующие семейные беседы часто вызывают наибольшие трудности, и голосовой агент позволяет заранее отрепетировать подобные сценарии.
Архитектурные ограничения и детерминированная логика
В ходе первых внутренних хакатонов команда создала простой прототип с минимальными защитными механизмами. Однако этап тестирования в продакшене выявил два типа сбоев: ответы, недостаточно чувствительные к контексту, и попытки агента давать юридические консультации. Чтобы исключить подобные риски, разработчики сформулировали ключевой архитектурный принцип: решение, которое можно принять детерминистически вне модели, не должно передаваться модели.
Ответственность была распределена между специализированными слоями системы. Бизнес-логика определяет доступные сценарии разговора, контекстный слой фильтрует релевантную информацию, системные промпты задают тон беседы, а аппаратные защитные механизмы (guardrails) предотвращают выход за допустимые рамки контента. Такой подход гарантирует, что вероятностная природа ИИ не нарушит заданные стандарты безопасности.
Управление контекстом и оценка качества (Evals)
Вместо того чтобы передавать модели сырые внутренние структуры данных, разработчики создали специализированный слой, агрегирующий минимальный и предварительно обработанный контекст для каждой сессии. Для каждой беседы сохраняется снимок (Snapshot) отправленного контекста, что позволяет проводить точную отладку и ретроспективный анализ поведения генеративной системы.
Тестирование не детерминированных систем потребовало внедрения трехуровневой системы оценки (Evals):
-
Автоматизированные тесты для проверки ключевых сценариев и регрессий.
-
Оценка человеком (Human evaluation) для измерения эмпатии, естественности и тонкости контекста.
-
Синтетические агенты и синтетические данные для симуляции масштабных пользовательских сценариев.
Помимо оптимизации фактической и воспринимаемой задержки (Latency), разработчики уделили особое внимание локализации: для британских пользователей голосовой агент был настроен на использование соответствующего акцента и локальной терминологии, подтверждая, что в голосовых интерфейсах голос и время отклика являются неотъемлемой частью пользовательского опыта.





