When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
Можно ли улучшать синтез речи обучением с подкреплением по автоматической субъективной оценке и получить то же предпочтение у людей? Работа даёт осторожный ответ: GRPO хорошо двигает выбранный предиктор и иногда превосходит исходную модель, но почти не обгоняет простое ранжирование восьми готовых вариантов.
Метод. Кодековая речевая модель оптимизируется отдельно по AnimeScore, UTMOS, Likability и возбуждению VAD. CER разбит на зоны: до 0,10 считается чистой областью, 0,10–0,30 — допустимой, выше 0,30 включается штраф. GRPO сравнивается с выбором лучшего из четырёх или восьми образцов по тому же предиктору; человеческая проверка охватывает по 50 примеров и пять оценщиков для трёх основных осей.
Результаты. GRPO увеличивает собственную награду: AnimeScore на 1,353, UTMOS на 0,485, Likability на 0,167. В сравнении с исходной моделью люди предпочитают GRPO в 80% случаев для AnimeScore, 62% для UTMOS и только 36% для Likability. Против Best-of-8 доли побед равны 52%, 46% и 48%, то есть уверенного превосходства нет. Для VAD возбуждение остаётся около 0,61–0,64; оптимизатор в основном выводит образцы из зоны плохого CER, а не меняет эмоциональность.
Ограничения. Предикторы различаются архитектурой и обучающими данными, поэтому сравнение наград не изолирует психологические оси. Есть одна базовая модель, один режим декодирования, небольшая человеческая выборка и нет нескольких случайных запусков. Обучение дорого: около 115 с на шаг с Whisper на двух H100, 1671 шаг. Английскую речь оценивала преимущественно японская группа слушателей.
Фишка из статьи. Обучение с подкреплением не демонстрирует преимущества над вычислительно простым Best-of-8, хотя сильнее двигает численную награду. Это отделяет «предиктор удалось оптимизировать» от «люди слышат более удачную речь».
| Награда | Best-of-8: прирост / CER / нарушения | GRPO: прирост / CER / нарушения | Победа GRPO над Best-of-8 у людей |
|---|---|---|---|
| AnimeScore | +1,21 / 0,070 / 10% | +1,35 / 0,054 / 16% | 52% |
| UTMOS | +0,47 / 0,055 / 10% | +0,49 / 0,074 / 6% | 46% |
| Likability | +0,14 / 0,043 / 10% | +0,17 / 0,098 / 6% | 48% |
Как это читать: прирост относится к соответствующему автоматическому предиктору, CER — медианная ошибка символов, нарушения — доля образцов за допустимой зоной. Человеческие 46–52% против Best-of-8 совместимы с ничьей, несмотря на больший сдвиг награды.