Эмоциональный TTS: персональные A-V пространства вместо одной шкалы
Эта работа полезна тем, что рассматривает эмоциональный синтез речи не как выбор одной метки "happy" или "sad", а как настройку пространства arousal-valence под конкретного слушателя и культуру. Авторы показывают, что усредненные A-V координаты могут не совпадать с тем, как эмоцию слышит пользователь, и используют Interactive Genetic Algorithm для персонализации. Главная идея - не переобучать весь синтезатор, а сдвигать управляющие эмоциональные координаты через предпочтения слушателя.
Метод. В основе стоит Grad-TTS с 80-мерными mel-спектрограммами и HiFi-GAN vocoder. Базовая версия получает простую A-V embedding-условность, а предложенный вариант добавляет эмоциональный контроллер и фиксированное пространство признаков из модели распознавания эмоций. Участник в цикле IGA выбирает более подходящие варианты, после чего популяция A-V точек мутирует; начальная сила мутации 0.20, decay 0.90, нижняя граница 0.05. В эксперименте участвовали 30 человек из китайской, индонезийской и японской групп, по 10 на группу.
Результаты. До персонализации эмоциональный контроллер уже улучшает качество относительно Grad-TTS с простой emotion embedding: MOS растет с 3.37 до 3.75, WER снижается с 21% до 17%, CCC по arousal растет с 0.60 до 0.84, по valence - с 0.64 до 0.77. В слепом A/B тесте персонализированная речь получает 76% предпочтений против U.S.-based baseline. Культурно усредненные A-V пространства тоже выигрывают у baseline: 64.8%, 69.8% и 65.6% предпочтений. В cross-cultural ранжировании участники чаще выбирают свою культурную карту: Chinese 65%, Japanese 67%, Indonesian 70%.
Ограничения. Это небольшой user study: 30 участников и три азиатские культурные группы, поэтому культурные выводы нельзя обобщать глобально. Персонализация требует интерактивного выбора пользователем, а не работает полностью автоматически. Синтезатор и SER-признаки фиксированы, так что качество зависит от того, насколько их A-V пространство действительно отражает человеческое восприятие. Нет оценки долгосрочной утомляемости, стабильности предпочтений и переноса на другие языки.
Фишка из статьи. Интересна не только прибавка MOS, а расхождение между индивидуальными и датасетными эмоциональными координатами. Авторы показывают, что пользователи из разных групп систематически выбирают разные A-V точки для одних и тех же эмоций, а затем это слышимо отражается в A/B предпочтениях.
| Сравнение | Метрика | Baseline | Предложенный вариант |
|---|---|---|---|
| Качество речи | MOS | 3.37 +/- 0.10 | 3.75 +/- 0.09 |
| Разборчивость | WER | 21% | 17% |
| Эмоциональная близость | CCC arousal | 0.60 | 0.84 |
| Эмоциональная близость | CCC valence | 0.64 | 0.77 |
| Персонализация | A/B preference | 24% | 76% |
Как это читать: снижение WER здесь вторично, а главный сигнал - CCC и A/B preference. Если слушатели выбирают персонализированную A-V карту в 76% случаев, значит эмоциональная "правильность" в TTS не сводится к одной универсальной разметке эмоций.