Синтез речи Оценка WER
Оценка синтеза речи

Best-of-N оценка синтеза речи: распознаватель может смещать выводы

WER 1.61%

Статья показывает неприятную, но практически важную ловушку в оценке синтеза речи: если выбирать лучший из N вариантов через распознаватель речи, итоговая «лучшесть» зависит от семейства распознавателя, которым потом считают ошибку. На LibriSpeech-PC test-clean и F5-TTS авторы показывают, что один и тот же набор сгенерированных аудио ранжируется по-разному Whisper-, wav2vec- и HuBERT-подобными оценщиками. Главный вывод: best-of-N может улучшать WER, но отчет по одному распознавателю легко превращается в самоусиление конкретной модели-оценщика.

Метод. Для каждого текста F5-TTS генерирует несколько кандидатов. Затем разные проверяющие распознаватели выбирают вариант с меньшей ошибкой распознавания, а итоговое аудио оценивается несколькими независимыми семействами распознавателей. Авторы сравнивают одиночные проверяющие модели и два межсемейных ансамбля рангов: усреднение рангов и выбор по худшему рангу, где кандидат должен быть хорош сразу для двух семейств.

Результаты. Под официальным F5-TTS оценщиком fwhisper-lgv3 baseline WER равен 2.06%, а best-of-N с distil-v3 снижает его до 1.88% при RTF 0.379 против 0.190 у baseline. Но перекрестная проверка меняет картину: wav2vec-оценщик предпочитает w2v2-base, а не distil-v3. При N=10 межсемейные rank-avg и max-rank дают средний WER 1.61% по трем оценщикам, то есть примерно на 12% лучше baseline 1.83%, без заметной просадки SIM-o и UTMOS.

Ограничения. Работа проверена на одном синтезаторе F5-TTS и одном корпусе LibriSpeech-PC test-clean, поэтому масштаб эффекта может измениться на других языках, голосах и доменах. Метрики естественности остаются автоматическими, а не слушательскими. Кроме того, best-of-N увеличивает стоимость генерации и проверки пропорционально числу кандидатов.

Фишка из статьи. Самое полезное здесь - таблица oracle headroom: она показывает, что проблема не только в абсолютном WER, а в том, сколько потенциального выигрыша «восстанавливает» пара проверяющий-оценщик из одного семейства.

ОценщикSingle-shotOracle N=3HeadroomRecovery w2v2-baseRecovery distil-v3
fwhisper-lgv32.041.420.63 pp7.9%26.0%
w2v2-lv601.521.090.43 pp26.1%18.2%
hubert-lg1.941.180.76 pp27.1%27.1%

Как это читать: один и тот же проверяющий выглядит сильным или слабым в зависимости от того, каким семейством распознавателей его судят. Поэтому для синтеза речи безопаснее показывать несколько независимых оценщиков или использовать межсемейное ранжирование.

Оригинальная статья на arXiv