TTS Emotion Reward
Emotional TTS

HPRO: reward optimization для эмоционального TTS без развала текста

WER 4.02%

HPRO рассматривает типичную проблему LLM-based emotional TTS: если напрямую усиливать эмоциональность, модель легко портит content или уходит в стереотипную просодию. Авторы вводят HD-Emo codec как differentiable reward model, который разделяет content-preference и style-preference tokens, а затем обучают TTS через progressive rewards на frame, word и sentence уровнях. Ценность статьи в том, что reward optimization не сводится к одному глобальному эмоциональному score.

Метод

HD-Emo codec строится поверх discrete speech tokens и извлекает две preference-подпоследовательности: content tokens контролируются ASR supervision, style tokens — speech emotion recognition и word-level Valence-Arousal-Dominance constraints. HPRO затем добавляет цели постепенно: сначала dense frame-level alignment, затем word-level wVAD, затем sentence-level emotion objective. Это создает gradient bridge между dense acoustic generation и sparse global emotion reward.

Такой дизайн явно борется с information conflict: если content и emotion живут в одном latent space, эмоциональный reward может перетянуть acoustic representation и повысить WER. Разделение preference tokens должно оставить семантику стабильной.

Результаты

  • На LSSED и EmoVoice-DB HPRO получает MOS-N 4.171±0.318, MOS-E 3.650±0.347, WER 4.02%, wVAD-CCC 0.339, EMO-SIM 0.672 и DNSMOS 3.73.
  • По WER HPRO лучше CosyVoice2 (5.45%), CosyVoice3 (4.90%), IndexTTS2 (6.74%) и HD-PPT (4.92%).
  • IndexTTS2 имеет более высокий MOS-E 3.692, но при худших WER 6.74% и DNSMOS 3.53; авторы интерпретируют это как чрезмерную/stereotyped emotion intensity.
  • Progressive ablation показывает, что +Word дает лучший WER 3.99% и wVAD-CCC 0.350, а +Sentence повышает EMO-SIM до 0.672.

Ограничения

Метрики emotion similarity и wVAD-CCC завязаны на внешние модели и могут не совпадать с человеческой оценкой в сложных эмоциях или культурах. В статье нет полного stress-test на long-form speech, code-switching и noisy prompts. Также HPRO оптимизирует конкретный LLM-TTS stack и HD-Emo codec; перенос на другие токенизаторы и языки потребует проверки.

Фишка из статьи. Самая полезная ablation — удаление content reward. Оно резко повышает WER до 13.61%, показывая, что emotional reward без отдельного content якоря действительно может ломать текст.

Вариант rewardWERwVAD-CCCEMO-SIM
w/o content13.61%0.2850.584
w/o emotion3.80%0.2950.637
w/o frame4.97%0.3330.608
w/o frame & wVAD4.35%0.3150.662
HPRO4.02%0.3390.672

Как это читать: эмоциональность в TTS нельзя оптимизировать как один scalar reward. Нужен content-preserving контур, иначе модель может “выиграть” emotion metric ценой разборчивости и семантики.

Оригинальная статья на arXiv