За пределами описаний речи: планирование стиля разговорного синтеза по акустической награде
SRSP решает практическую проблему управляемого синтеза: красивое текстовое описание стиля ещё не означает, что конкретный синтезатор воспроизведёт нужную акустику. Поэтому планировщик стиля обучают не по сходству текста и аудио, а по тому, насколько замороженная TTS-модель повышает вероятность целевых речевых токенов.
Метод. Qwen3.5-9B получает историю диалога и реплику, генерирует восемь инструкций о манере произнесения и обновляется методом GRPO. Награда вычисляется через замороженный Fun-CosyVoice3-0.5B по teacher-forced likelihood эталонной речи; сам синтезатор не дообучается. Для проверки отделены фильмы, полностью отсутствующие в обучении.
Результаты. SRSP получает лучшую акустическую близость во всех пяти метриках на внутридоменной и междоменной выборках: MCD-DTW 5,96/6,16 против 6,34/6,51 у исходного LLM. В парных LLM-оценках его стиль предпочитают исходному планировщику в 54,2/53,7% случаев по контексту и в 60,9/57,8% по эталонной записи.
Ограничения. Проверка проведена на английской части одного киноразговорного корпуса и одном TTS-бэкенде. Часть субъективной оценки выполняет Gemini, а не слушатели. Награда зависит от teacher forcing и может плохо отражать ошибки свободной генерации.
Фишка из статьи. Самый сильный генератор подписей к аудио оказался худшим управляющим интерфейсом. Audio Flamingo Next лучше всех согласует описание с записью, но его инструкции дают худшую акустическую близость после синтеза.
| Источник инструкции | Доступ к эталонному аудио | S2S ParaCLAP-C | MCD-DTW |
|---|---|---|---|
| Без инструкции | нет | 0,337/0,349 | 6,243/6,393 |
| Исходный LLM | нет | 0,317/0,322 | 6,340/6,507 |
| Audio Flamingo Next | да | 0,287/0,298 | 6,889/7,013 |
| SRSP | нет | 0,363/0,363 | 5,957/6,164 |
Как это читать: значения приведены для test-in/test-out. Текстово-аудиальное сходство инструкции и качество управления синтезом расходятся; оптимизировать нужно конечную акустику, а не убедительность подписи.