Оценка качества Синтез речи Метрики
arXiv cs.SD

Beyond Naturalness: что не видят автоматические оценщики синтеза речи

arXiv:2608.09930

Статья критикует привычку сводить оценку синтеза речи к одной «естественности». Авторы раскладывают восприятие на 10 лингвистически осмысленных измерений, от фонетической точности до эмоции и правдоподобности голоса, и проверяют MOS-предикторы и Audio-LLM-судей по каждому измерению отдельно. Интересна работа именно как метаоценка: она показывает, где автоматические оценщики систематически молчат.

Метод. Датасет состоит из 860 аудиопримеров с majority-vote разметкой обученных лингвистов. Ошибки создаются управляемо: через изменение IPA/текста, Praat-манипуляции F0 и длительности, cross-speaker fading и набор DSP-артефактов. Затем четыре MOS-предиктора и четыре Audio-LLM-судьи сравниваются с человеческой бинарной разметкой через Kendall tau и AUROC.

Результаты. MOS-предикторы сильнее реагируют на акустические и DSP-видимые измерения, например speech rate у AudioBoxCE дает tau 0.550, а human plausibility - 0.606. При этом фонетическая точность и lexical stress часто около нуля или отрицательны. Audio-LLM с расшифровкой лучше ловит отдельные языковые ошибки: Gemini 3.5 Flash в базовом prompt дает tau 0.412 для phonetic accuracy и 0.312 для lexical stress, но не дает надежного покрытия всех 10 измерений. Авторы также показывают, что из 741 намеренно испорченного примера люди пропустили 239, то есть 32.3%, а чистые примеры имели только 3.5% false alarm.

Ограничения. Ошибки в значительной степени синтетические: Cartesia Sonic-3, короткие Harvard Sentences, Praat и заданные DSP-рецепты. Такие стимулы полезны для контролируемой проверки, но не являются естественной выборкой отказов продакшен-синтеза. Работа обозначена как work in progress, поэтому бенчмарк и выводы стоит считать сильной диагностикой, а не окончательным стандартом оценки.

Фишка из статьи. Неожиданный слой статьи - сами люди не всегда ловят искусственно внесенные ошибки, и miss rate сильно зависит от измерения.

СравнениеЧислоЧто означает
Фонетическая точностьmiss rate 21.2%Фонемные подмены сравнительно заметны
Лексическое ударение38.4%Ошибки ударения уже часто пропускаются
Интонация40.0%F0-искажения не всегда интерпретируются как ошибка
Эмоциональная уместность46.2%Контекстно-зависимое измерение сложнее всего
Идентичность диктора48.4%Даже cross-speaker drift трудно разметить стабильно

Как это читать: если человеческая разметка имеет такие разные miss rates, одна автоматическая MOS-оценка тем более не может быть универсальной заменой многоизмерительного протокола.

Оригинальная статья на arXiv