GROW: обучение с подкреплением для flow-matching синтеза речи
Статья решает узкую, но важную проблему: как дообучать flow-matching синтез речи через награды, не превращая детерминированный ODE-сэмплинг в более дорогой и шумный SDE-policy-gradient. GROW действует прямо на стандартную регрессию flow matching и взвешивает rollout по group-relative advantage. Интерес в том, что метод улучшает и разборчивость, и похожесть говорящего, не вводя отдельную траекторную likelihood-механику.
Метод. GROW применяется к DiTAR, авторегрессионно-диффузионной модели речи. Для каждого prompt берется группа из 8 on-policy utterances; каждая оценивается по распознаванию речи (reward 1 - WER) и похожести говорящего. Награды отдельно стандартизируются внутри группы и суммируются с равными весами, после чего signed advantage масштабирует flow-matching loss. W2 velocity anchor удерживает модель рядом с замороженной pretrained reference, чтобы reward-driven update не разрушал акустическую динамику.
Результаты. При основном режиме rollout NFE=10 и evaluation NFE=32 GROW снижает WER на LibriSpeech-PC до 1.927, Seed-TTS EN до 1.763 и Seed-TTS ZH до 0.983; speaker similarity при этом 0.701/0.702/0.742. Средний выигрыш относительно pretrain составляет +0.458 по WER-reduction и +0.039 по SIM при UTMOS +0.02. По сравнению с DiTAR-GRPO при NFE=32 GROW с NFE=10 обучается в 2.9 раза быстрее.
Ограничения. Оценка использует те же типы reward models, что и обучение: Whisper/Paraformer для WER и WavLM для похожести говорящего, поэтому human preference остается открытым вопросом. Эксперименты проведены на сильной pretrained модели с уже концентрированными reward, и пока не ясно, как метод ведет себя на слабых моделях или более выразительном синтезе. Код и checkpoints заявлены к публикации, но результат требует воспроизведения.
Фишка из статьи. Центральная абляция показывает, почему обычное положительное exponential weighting плохо работает на сильном синтезаторе: reward почти не контрастирует внутри группы и превращается в self-imitation. Signed normalized advantage сохраняет полезный знак обновления.
| Вес rollout | Avg WER reduction | Avg SIM gain | Комментарий |
|---|---|---|---|
| exp(tau A) | 0.199 | -0.003 | много self-imitation |
| exp(tau r) | 0.095 | 0.000 | сырой reward почти не помогает |
| A / sigma | 0.458 | 0.039 | основной вариант GROW |
Как это читать: выигрыш GROW не в том, что он просто выбирает лучшие samples. Он центрирует награды внутри prompt-группы, убирает reward-agnostic компонент и тем самым делает обновление именно сравнительным.