Синтез речи RL Flow matching
RL для синтеза речи

GROW: обучение с подкреплением для flow-matching синтеза речи

2.9x train

Статья решает узкую, но важную проблему: как дообучать flow-matching синтез речи через награды, не превращая детерминированный ODE-сэмплинг в более дорогой и шумный SDE-policy-gradient. GROW действует прямо на стандартную регрессию flow matching и взвешивает rollout по group-relative advantage. Интерес в том, что метод улучшает и разборчивость, и похожесть говорящего, не вводя отдельную траекторную likelihood-механику.

Метод. GROW применяется к DiTAR, авторегрессионно-диффузионной модели речи. Для каждого prompt берется группа из 8 on-policy utterances; каждая оценивается по распознаванию речи (reward 1 - WER) и похожести говорящего. Награды отдельно стандартизируются внутри группы и суммируются с равными весами, после чего signed advantage масштабирует flow-matching loss. W2 velocity anchor удерживает модель рядом с замороженной pretrained reference, чтобы reward-driven update не разрушал акустическую динамику.

Результаты. При основном режиме rollout NFE=10 и evaluation NFE=32 GROW снижает WER на LibriSpeech-PC до 1.927, Seed-TTS EN до 1.763 и Seed-TTS ZH до 0.983; speaker similarity при этом 0.701/0.702/0.742. Средний выигрыш относительно pretrain составляет +0.458 по WER-reduction и +0.039 по SIM при UTMOS +0.02. По сравнению с DiTAR-GRPO при NFE=32 GROW с NFE=10 обучается в 2.9 раза быстрее.

Ограничения. Оценка использует те же типы reward models, что и обучение: Whisper/Paraformer для WER и WavLM для похожести говорящего, поэтому human preference остается открытым вопросом. Эксперименты проведены на сильной pretrained модели с уже концентрированными reward, и пока не ясно, как метод ведет себя на слабых моделях или более выразительном синтезе. Код и checkpoints заявлены к публикации, но результат требует воспроизведения.

Фишка из статьи. Центральная абляция показывает, почему обычное положительное exponential weighting плохо работает на сильном синтезаторе: reward почти не контрастирует внутри группы и превращается в self-imitation. Signed normalized advantage сохраняет полезный знак обновления.

Вес rolloutAvg WER reductionAvg SIM gainКомментарий
exp(tau A)0.199-0.003много self-imitation
exp(tau r)0.0950.000сырой reward почти не помогает
A / sigma0.4580.039основной вариант GROW

Как это читать: выигрыш GROW не в том, что он просто выбирает лучшие samples. Он центрирует награды внутри prompt-группы, убирает reward-agnostic компонент и тем самым делает обновление именно сравнительным.

Оригинальная статья на arXiv