Speech interface TTS Avatar
arXiv cs.CL

EmpaAva: голосовой эмпатический 3D-аватар с агентной архитектурой

arXiv:2608.04709

EmpaAva - системная работа про голосового эмпатического чат-бота с 3D-аватаром, а не новая модель распознавания речи или синтеза голоса сама по себе. Она интересна как сборка полного контура: пользователь говорит, система распознает речь и эмоциональные признаки, планирует ответ, синтезирует эмоциональную речь и рендерит синхронизированное лицо. Для речевых интерфейсов это пример того, какие метрики появляются, когда звук, текст и визуальное поведение должны работать вместе.

Метод. Архитектура разбита на три агента. PerceptionAgent готовит транскрипт, оценку эмоции по речи и опциональный визуальный контекст. ResponseAgent строит структурированный план ответа: текст, тон, эмоцию, голос, аватар и основание для реакции. RenderAgent превращает план в мультимодальный ответ через EmoVoice TTS, DEEPTalk motion, FLAME-контроль и 3D Gaussian Splatting, с дополнительным сглаживанием движения и коррекцией синхронизации губ.

Результаты. В анкете 10 участников оценивали по 5 ходов и четыре анонимных ответа, всего 50 предпочтений. EmpaAva получает 18 голосов предпочтения против 13 у AvaMERG, 12 у EmpathyEar и 7 у BlenderBot; средние оценки: empathy 4.42, relevance 4.65, specificity 4.35. На автоматической оценке выражения аватара EmpaAva показывает LSE-C 7.649, LSE-D 8.242 и A-V Cos 0.346; для Wav2Lip это 6.452, 7.940 и 0.339, для DEEPTalk - 1.432, 13.491 и 0.338.

Ограничения. Человеческая оценка мала: 10 участников и 50 preference votes недостаточны для сильных выводов о надежности эмпатии. Работа в основном интеграционная, поэтому вклад каждого внешнего модуля нужно читать отдельно. Безопасность эмоциональной поддержки, задержка живого диалога, устойчивость распознавания эмоций и поведение на чувствительных темах остаются слабо раскрытыми.

Фишка из статьи. Хороший инженерный момент - явный reply plan, который связывает слова, голос, выражение лица и доказательство выбранной реакции.

СистемаEmpathyRelevanceSpecificityPreference из 50
BlenderBot4.364.534.177
EmpathyEar4.364.474.2512
AvaMERG4.184.434.0713
EmpaAva4.424.654.3518

Как это читать: превосходство есть, но оно пока скорее прототипное. Метрика предпочтений полезна как сигнал, что согласование речевой эмоции, текста и аватара воспринимается лучше, но выборка слишком мала для вывода о стабильной клинической или психологической пользе.

Оригинальная статья на arXiv