HPRO: reward optimization для эмоционального TTS без развала текста
HPRO рассматривает типичную проблему LLM-based emotional TTS: если напрямую усиливать эмоциональность, модель легко портит content или уходит в стереотипную просодию. Авторы вводят HD-Emo codec как differentiable reward model, который разделяет content-preference и style-preference tokens, а затем обучают TTS через progressive rewards на frame, word и sentence уровнях. Ценность статьи в том, что reward optimization не сводится к одному глобальному эмоциональному score.
Метод
HD-Emo codec строится поверх discrete speech tokens и извлекает две preference-подпоследовательности: content tokens контролируются ASR supervision, style tokens — speech emotion recognition и word-level Valence-Arousal-Dominance constraints. HPRO затем добавляет цели постепенно: сначала dense frame-level alignment, затем word-level wVAD, затем sentence-level emotion objective. Это создает gradient bridge между dense acoustic generation и sparse global emotion reward.
Такой дизайн явно борется с information conflict: если content и emotion живут в одном latent space, эмоциональный reward может перетянуть acoustic representation и повысить WER. Разделение preference tokens должно оставить семантику стабильной.
Результаты
- На LSSED и EmoVoice-DB HPRO получает MOS-N 4.171±0.318, MOS-E 3.650±0.347, WER 4.02%, wVAD-CCC 0.339, EMO-SIM 0.672 и DNSMOS 3.73.
- По WER HPRO лучше CosyVoice2 (5.45%), CosyVoice3 (4.90%), IndexTTS2 (6.74%) и HD-PPT (4.92%).
- IndexTTS2 имеет более высокий MOS-E 3.692, но при худших WER 6.74% и DNSMOS 3.53; авторы интерпретируют это как чрезмерную/stereotyped emotion intensity.
- Progressive ablation показывает, что +Word дает лучший WER 3.99% и wVAD-CCC 0.350, а +Sentence повышает EMO-SIM до 0.672.
Ограничения
Метрики emotion similarity и wVAD-CCC завязаны на внешние модели и могут не совпадать с человеческой оценкой в сложных эмоциях или культурах. В статье нет полного stress-test на long-form speech, code-switching и noisy prompts. Также HPRO оптимизирует конкретный LLM-TTS stack и HD-Emo codec; перенос на другие токенизаторы и языки потребует проверки.
Фишка из статьи. Самая полезная ablation — удаление content reward. Оно резко повышает WER до 13.61%, показывая, что emotional reward без отдельного content якоря действительно может ломать текст.
| Вариант reward | WER | wVAD-CCC | EMO-SIM |
|---|---|---|---|
| w/o content | 13.61% | 0.285 | 0.584 |
| w/o emotion | 3.80% | 0.295 | 0.637 |
| w/o frame | 4.97% | 0.333 | 0.608 |
| w/o frame & wVAD | 4.35% | 0.315 | 0.662 |
| HPRO | 4.02% | 0.339 | 0.672 |
Как это читать: эмоциональность в TTS нельзя оптимизировать как один scalar reward. Нужен content-preserving контур, иначе модель может “выиграть” emotion metric ценой разборчивости и семантики.