Синтетическая речь GRPO WER
Доменное распознавание

GRPO на синтетической речи для доменного распознавания

WER 20.21%

Статья исследует ситуацию, хорошо знакомую регулируемым доменам: настоящую речь клиентов трудно хранить и размечать, поэтому для адаптации распознавания хочется использовать синтезированную речь. Обычное дообучение на такой синтетике страдает от акустического разрыва, и авторы проверяют, может ли GRPO извлечь больше пользы из тех же данных. Главный результат: на синтетической банковской речи GRPO резко снижает WER относительно SFT, но «больше синтетики» не всегда лучше.

Метод. Базовая модель адаптируется от LibriSpeech-960h SFT checkpoint к банковскому домену. Сравниваются обычное supervised fine-tuning, GRPO с наградой за низкую WER-гипотезу и каскад SFT -> GRPO. Данные состоят из 54 часов реальной банковской речи и 54 часов синтетической банковской речи; отдельно авторы варьируют количество настоящей и синтетической речи.

Результаты. На настоящей банковской речи SFT дает WER 10.27%, прямой GRPO - 10.78%, а SFT -> GRPO - 9.49%. На синтетической речи различие намного больше: SFT получает 36.71% WER, GRPO - 22.09%, а SFT -> GRPO - 20.21%, то есть примерно 45% относительного снижения к SFT. Добавление небольшого количества настоящей речи быстро помогает: при фиксированных 54 часах синтетики WER падает с 22.09% без real data до 15.51% с 5 часами и 14.03% с 10 часами настоящей речи.

Ограничения. Домен узкий - банковская речь, а базовая модель и reward design могут сильно влиять на результат. GRPO снижает вставки, но иногда увеличивает удаления, поэтому улучшение WER не означает автоматически лучшую пользовательскую расшифровку. Также не показано, насколько хорошо вывод переносится на другие синтезаторы и языки.

Фишка из статьи. Самый полезный отрицательный результат: при фиксированном 1 часе настоящей речи увеличение синтетики сначала помогает, но затем ухудшает качество. Это важнее среднего выигрыша GRPO, потому что напрямую влияет на бюджет генерации данных.

Синтетическая речьНастоящая речьWERCERINS/DEL/SUB
1h1h24.6017.596.60 / 6.55 / 11.45
10h1h19.9113.775.22 / 5.27 / 9.42
25h1h16.7711.633.82 / 4.46 / 8.48
54h1h20.3214.087.25 / 4.16 / 8.91
25h5h14.5610.503.10 / 4.25 / 7.21

Как это читать: синтетическая речь полезна, но ее распределение может начать доминировать над малым количеством настоящих данных. Оптимальная стратегия здесь похожа не на «сгенерировать максимум», а на аккуратный баланс синтетики и небольшого реального якоря.

Оригинальная статья на arXiv