Обучение с подкреплением для японского синтеза речи по награде Kana-CER
Для японского синтеза речи обычная ошибка распознавания символов плохо соответствует произношению: разные чтения кандзи могут схлопываться в одной орфографии, а одинаковое звучание записываться по-разному. Авторы переносят награду GRPO в пространство каны и получают более прямой сигнал о правильном чтении.
Метод. Речь распознаётся отдельной моделью в катакану, а Kana-CER сравнивается с эталонным чтением. Сопоставление проводится при одинаковой модели 0,5B, одинаковом GRPO и пяти случайных зернах. Дополнительный независимый wav2vec2-распознаватель в хирагане проверяет, что улучшение не является подгонкой к модели награды; KL-регуляризация удерживает длину вывода.
Результаты. Ошибка чтения целевых кандзи падает с 9,65% при орфографической CER-награде до 7,17%, относительное снижение 25,7%; независимый распознаватель подтверждает 14,78% против 11,52%. Обычная CER практически одинакова, 4,10% и 4,15%, а UTMOS и сходство диктора не ухудшаются. Лучший checkpoint достигается на 4 тыс. шагов вместо 18 тыс.
Ограничения. Проверена одна модель на 0,5B и один язык; для обучения нужны эталонные чтения. Автоматические показатели качества не заменяют прослушивание редких чтений носителями. Бенчмарк специально нацелен на кандзи и может переоценивать пользу для обычного текста.
Фишка из статьи. Более точная фонетическая награда без KL-регуляризации вызывает неожиданную поломку: модель быстро удваивает длину ответа, хотя CER продолжает поощрять её вывод.
| Модель | Kana-CER по кандзи, % | Обычная CER, % | Шаг выбора |
|---|---|---|---|
| До RL | 10,77 | 6,08 | 0 |
| SFT | 7,61 | 5,20 | — |
| RL по обычной CER | 9,65 | 4,10 | 18 000 |
| RL по Kana-CER | 7,17 | 4,15 | 4 000 |
Как это читать: фонетическая награда быстрее оптимизирует именно чтение, но одновременно открывает короткий путь через растягивание последовательности. KL здесь не косметическая стабилизация, а обязательная защита от вырождения длины.