Beyond Naturalness: что не видят автоматические оценщики синтеза речи
Статья критикует привычку сводить оценку синтеза речи к одной «естественности». Авторы раскладывают восприятие на 10 лингвистически осмысленных измерений, от фонетической точности до эмоции и правдоподобности голоса, и проверяют MOS-предикторы и Audio-LLM-судей по каждому измерению отдельно. Интересна работа именно как метаоценка: она показывает, где автоматические оценщики систематически молчат.
Метод. Датасет состоит из 860 аудиопримеров с majority-vote разметкой обученных лингвистов. Ошибки создаются управляемо: через изменение IPA/текста, Praat-манипуляции F0 и длительности, cross-speaker fading и набор DSP-артефактов. Затем четыре MOS-предиктора и четыре Audio-LLM-судьи сравниваются с человеческой бинарной разметкой через Kendall tau и AUROC.
Результаты. MOS-предикторы сильнее реагируют на акустические и DSP-видимые измерения, например speech rate у AudioBoxCE дает tau 0.550, а human plausibility - 0.606. При этом фонетическая точность и lexical stress часто около нуля или отрицательны. Audio-LLM с расшифровкой лучше ловит отдельные языковые ошибки: Gemini 3.5 Flash в базовом prompt дает tau 0.412 для phonetic accuracy и 0.312 для lexical stress, но не дает надежного покрытия всех 10 измерений. Авторы также показывают, что из 741 намеренно испорченного примера люди пропустили 239, то есть 32.3%, а чистые примеры имели только 3.5% false alarm.
Ограничения. Ошибки в значительной степени синтетические: Cartesia Sonic-3, короткие Harvard Sentences, Praat и заданные DSP-рецепты. Такие стимулы полезны для контролируемой проверки, но не являются естественной выборкой отказов продакшен-синтеза. Работа обозначена как work in progress, поэтому бенчмарк и выводы стоит считать сильной диагностикой, а не окончательным стандартом оценки.
Фишка из статьи. Неожиданный слой статьи - сами люди не всегда ловят искусственно внесенные ошибки, и miss rate сильно зависит от измерения.
| Сравнение | Число | Что означает |
|---|---|---|
| Фонетическая точность | miss rate 21.2% | Фонемные подмены сравнительно заметны |
| Лексическое ударение | 38.4% | Ошибки ударения уже часто пропускаются |
| Интонация | 40.0% | F0-искажения не всегда интерпретируются как ошибка |
| Эмоциональная уместность | 46.2% | Контекстно-зависимое измерение сложнее всего |
| Идентичность диктора | 48.4% | Даже cross-speaker drift трудно разметить стабильно |
Как это читать: если человеческая разметка имеет такие разные miss rates, одна автоматическая MOS-оценка тем более не может быть универсальной заменой многоизмерительного протокола.