EmpaAva: голосовой эмпатический 3D-аватар с агентной архитектурой
EmpaAva - системная работа про голосового эмпатического чат-бота с 3D-аватаром, а не новая модель распознавания речи или синтеза голоса сама по себе. Она интересна как сборка полного контура: пользователь говорит, система распознает речь и эмоциональные признаки, планирует ответ, синтезирует эмоциональную речь и рендерит синхронизированное лицо. Для речевых интерфейсов это пример того, какие метрики появляются, когда звук, текст и визуальное поведение должны работать вместе.
Метод. Архитектура разбита на три агента. PerceptionAgent готовит транскрипт, оценку эмоции по речи и опциональный визуальный контекст. ResponseAgent строит структурированный план ответа: текст, тон, эмоцию, голос, аватар и основание для реакции. RenderAgent превращает план в мультимодальный ответ через EmoVoice TTS, DEEPTalk motion, FLAME-контроль и 3D Gaussian Splatting, с дополнительным сглаживанием движения и коррекцией синхронизации губ.
Результаты. В анкете 10 участников оценивали по 5 ходов и четыре анонимных ответа, всего 50 предпочтений. EmpaAva получает 18 голосов предпочтения против 13 у AvaMERG, 12 у EmpathyEar и 7 у BlenderBot; средние оценки: empathy 4.42, relevance 4.65, specificity 4.35. На автоматической оценке выражения аватара EmpaAva показывает LSE-C 7.649, LSE-D 8.242 и A-V Cos 0.346; для Wav2Lip это 6.452, 7.940 и 0.339, для DEEPTalk - 1.432, 13.491 и 0.338.
Ограничения. Человеческая оценка мала: 10 участников и 50 preference votes недостаточны для сильных выводов о надежности эмпатии. Работа в основном интеграционная, поэтому вклад каждого внешнего модуля нужно читать отдельно. Безопасность эмоциональной поддержки, задержка живого диалога, устойчивость распознавания эмоций и поведение на чувствительных темах остаются слабо раскрытыми.
Фишка из статьи. Хороший инженерный момент - явный reply plan, который связывает слова, голос, выражение лица и доказательство выбранной реакции.
| Система | Empathy | Relevance | Specificity | Preference из 50 |
|---|---|---|---|---|
| BlenderBot | 4.36 | 4.53 | 4.17 | 7 |
| EmpathyEar | 4.36 | 4.47 | 4.25 | 12 |
| AvaMERG | 4.18 | 4.43 | 4.07 | 13 |
| EmpaAva | 4.42 | 4.65 | 4.35 | 18 |
Как это читать: превосходство есть, но оно пока скорее прототипное. Метрика предпочтений полезна как сигнал, что согласование речевой эмоции, текста и аватара воспринимается лучше, но выборка слишком мала для вывода о стабильной клинической или психологической пользе.