Best-of-N оценка синтеза речи: распознаватель может смещать выводы
Статья показывает неприятную, но практически важную ловушку в оценке синтеза речи: если выбирать лучший из N вариантов через распознаватель речи, итоговая «лучшесть» зависит от семейства распознавателя, которым потом считают ошибку. На LibriSpeech-PC test-clean и F5-TTS авторы показывают, что один и тот же набор сгенерированных аудио ранжируется по-разному Whisper-, wav2vec- и HuBERT-подобными оценщиками. Главный вывод: best-of-N может улучшать WER, но отчет по одному распознавателю легко превращается в самоусиление конкретной модели-оценщика.
Метод. Для каждого текста F5-TTS генерирует несколько кандидатов. Затем разные проверяющие распознаватели выбирают вариант с меньшей ошибкой распознавания, а итоговое аудио оценивается несколькими независимыми семействами распознавателей. Авторы сравнивают одиночные проверяющие модели и два межсемейных ансамбля рангов: усреднение рангов и выбор по худшему рангу, где кандидат должен быть хорош сразу для двух семейств.
Результаты. Под официальным F5-TTS оценщиком fwhisper-lgv3 baseline WER равен 2.06%, а best-of-N с distil-v3 снижает его до 1.88% при RTF 0.379 против 0.190 у baseline. Но перекрестная проверка меняет картину: wav2vec-оценщик предпочитает w2v2-base, а не distil-v3. При N=10 межсемейные rank-avg и max-rank дают средний WER 1.61% по трем оценщикам, то есть примерно на 12% лучше baseline 1.83%, без заметной просадки SIM-o и UTMOS.
Ограничения. Работа проверена на одном синтезаторе F5-TTS и одном корпусе LibriSpeech-PC test-clean, поэтому масштаб эффекта может измениться на других языках, голосах и доменах. Метрики естественности остаются автоматическими, а не слушательскими. Кроме того, best-of-N увеличивает стоимость генерации и проверки пропорционально числу кандидатов.
Фишка из статьи. Самое полезное здесь - таблица oracle headroom: она показывает, что проблема не только в абсолютном WER, а в том, сколько потенциального выигрыша «восстанавливает» пара проверяющий-оценщик из одного семейства.
| Оценщик | Single-shot | Oracle N=3 | Headroom | Recovery w2v2-base | Recovery distil-v3 |
|---|---|---|---|---|---|
| fwhisper-lgv3 | 2.04 | 1.42 | 0.63 pp | 7.9% | 26.0% |
| w2v2-lv60 | 1.52 | 1.09 | 0.43 pp | 26.1% | 18.2% |
| hubert-lg | 1.94 | 1.18 | 0.76 pp | 27.1% | 27.1% |
Как это читать: один и тот же проверяющий выглядит сильным или слабым в зависимости от того, каким семейством распознавателей его судят. Поэтому для синтеза речи безопаснее показывать несколько независимых оценщиков или использовать межсемейное ранжирование.