синтез речи японский язык обучение с подкреплением
arXiv cs.SD

Обучение с подкреплением для японского синтеза речи по награде Kana-CER

arXiv:2610.07575

Для японского синтеза речи обычная ошибка распознавания символов плохо соответствует произношению: разные чтения кандзи могут схлопываться в одной орфографии, а одинаковое звучание записываться по-разному. Авторы переносят награду GRPO в пространство каны и получают более прямой сигнал о правильном чтении.

Метод. Речь распознаётся отдельной моделью в катакану, а Kana-CER сравнивается с эталонным чтением. Сопоставление проводится при одинаковой модели 0,5B, одинаковом GRPO и пяти случайных зернах. Дополнительный независимый wav2vec2-распознаватель в хирагане проверяет, что улучшение не является подгонкой к модели награды; KL-регуляризация удерживает длину вывода.

Результаты. Ошибка чтения целевых кандзи падает с 9,65% при орфографической CER-награде до 7,17%, относительное снижение 25,7%; независимый распознаватель подтверждает 14,78% против 11,52%. Обычная CER практически одинакова, 4,10% и 4,15%, а UTMOS и сходство диктора не ухудшаются. Лучший checkpoint достигается на 4 тыс. шагов вместо 18 тыс.

Ограничения. Проверена одна модель на 0,5B и один язык; для обучения нужны эталонные чтения. Автоматические показатели качества не заменяют прослушивание редких чтений носителями. Бенчмарк специально нацелен на кандзи и может переоценивать пользу для обычного текста.

Фишка из статьи. Более точная фонетическая награда без KL-регуляризации вызывает неожиданную поломку: модель быстро удваивает длину ответа, хотя CER продолжает поощрять её вывод.

МодельKana-CER по кандзи, %Обычная CER, %Шаг выбора
До RL10,776,080
SFT7,615,20—
RL по обычной CER9,654,1018 000
RL по Kana-CER7,174,154 000

Как это читать: фонетическая награда быстрее оптимизирует именно чтение, но одновременно открывает короткий путь через растягивание последовательности. KL здесь не косметическая стабилизация, а обязательная защита от вырождения длины.

Оригинальная статья на arXiv