синтез речи обучение с подкреплением субъективные оценки
arXiv cs.CL

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

arXiv:2608.31035

Можно ли улучшать синтез речи обучением с подкреплением по автоматической субъективной оценке и получить то же предпочтение у людей? Работа даёт осторожный ответ: GRPO хорошо двигает выбранный предиктор и иногда превосходит исходную модель, но почти не обгоняет простое ранжирование восьми готовых вариантов.

Метод. Кодековая речевая модель оптимизируется отдельно по AnimeScore, UTMOS, Likability и возбуждению VAD. CER разбит на зоны: до 0,10 считается чистой областью, 0,10–0,30 — допустимой, выше 0,30 включается штраф. GRPO сравнивается с выбором лучшего из четырёх или восьми образцов по тому же предиктору; человеческая проверка охватывает по 50 примеров и пять оценщиков для трёх основных осей.

Результаты. GRPO увеличивает собственную награду: AnimeScore на 1,353, UTMOS на 0,485, Likability на 0,167. В сравнении с исходной моделью люди предпочитают GRPO в 80% случаев для AnimeScore, 62% для UTMOS и только 36% для Likability. Против Best-of-8 доли побед равны 52%, 46% и 48%, то есть уверенного превосходства нет. Для VAD возбуждение остаётся около 0,61–0,64; оптимизатор в основном выводит образцы из зоны плохого CER, а не меняет эмоциональность.

Ограничения. Предикторы различаются архитектурой и обучающими данными, поэтому сравнение наград не изолирует психологические оси. Есть одна базовая модель, один режим декодирования, небольшая человеческая выборка и нет нескольких случайных запусков. Обучение дорого: около 115 с на шаг с Whisper на двух H100, 1671 шаг. Английскую речь оценивала преимущественно японская группа слушателей.

Фишка из статьи. Обучение с подкреплением не демонстрирует преимущества над вычислительно простым Best-of-8, хотя сильнее двигает численную награду. Это отделяет «предиктор удалось оптимизировать» от «люди слышат более удачную речь».

НаградаBest-of-8: прирост / CER / нарушенияGRPO: прирост / CER / нарушенияПобеда GRPO над Best-of-8 у людей
AnimeScore+1,21 / 0,070 / 10%+1,35 / 0,054 / 16%52%
UTMOS+0,47 / 0,055 / 10%+0,49 / 0,074 / 6%46%
Likability+0,14 / 0,043 / 10%+0,17 / 0,098 / 6%48%

Как это читать: прирост относится к соответствующему автоматическому предиктору, CER — медианная ошибка символов, нарушения — доля образцов за допустимой зоной. Человеческие 46–52% против Best-of-8 совместимы с ничьей, несмотря на больший сдвиг награды.

Оригинальная статья на arXiv