TTS evaluation: naturalness не равна appropriateness для разных доменов
Статья полезна тем, что атакует привычный shortcut в TTS evaluation: высокий naturalness/MOS не означает, что голос подходит для конкретного сценария. Авторы сравнивают пять сильных TTS-систем в пяти доменах — AI assistant, reader, actor, animated character и spontaneous speaker — и показывают, что “человечность” и contextual appropriateness могут расходиться вплоть до отрицательной корреляции.
Метод. В perceptual study участвуют Kokoro, Gemini TTS, Kyutai-TTS, GPT-4o-mini-tts и ElevenLabs, выбранные как сильные и стилистически разные системы; чтобы снизить voice-preference bias, использованы female voices с похожим timbre. Оцениваются appropriateness и human-likeness по доменам и речевым задачам. Дополнительно авторы считают акустические признаки: rhythm, articulation/speech rate, nPVI, F0 range, jitter/shimmer, CPPS, arousal/valence, а также automatic metrics вроде UTMOSv2, DNSMOS, SQuIM, PESQ, STOI, WER, AudioBox metrics и WavLM-style distances.
Результаты. Системы хорошо выглядят в reading/assistant-style задачах, но expressive domains остаются сложнее. Kokoro подходит для reading и assistant, но слабее в conversational tasks; Kyutai-TTS воспринимается естественно и уместно для spontaneous conversation, но хуже подходит для assistant и animated character. Inter-rater agreement низкий: Krippendorff alpha 0.2 для TTS samples и 0.44 для ground truth, то есть appropriateness субъективна. Ключевое число: корреляция human-likeness и appropriateness положительна для Actor (ρ=0.4705), Spontaneous (ρ=0.4021), Reader (ρ=0.3757), почти нулевая для Animated Character (ρ=0.0821) и отрицательная для Assistant (ρ=-0.4438).
Ограничения. Это perceptual study с ограниченным набором систем, голосов и доменов; все голоса намеренно сведены к похожему female timbre, поэтому выводы не покрывают gender/style diversity. Низкое agreement — не только недостаток, но и сигнал, что задача действительно субъективна. Автоматические метрики перечислены широко, однако статья скорее показывает blind spots, чем предлагает один новый финальный скорер.
Фишка из статьи. Самый интересный результат — доменный знак корреляции. Для assistant-сценария более human-like голос может восприниматься менее appropriate, тогда как для actor/spontaneous domains human-likeness обычно помогает.
| Домен | Spearman ρ: human-likeness vs appropriateness | Практический смысл |
|---|---|---|
| Spontaneous | 0.4021 | Естественность помогает conversational fit |
| Actor | 0.4705 | Выразительность и human-likeness согласованы |
| Reader | 0.3757 | Натуральность умеренно совпадает с уместностью |
| Animated character | 0.0821 | Почти нет связи: нужна стилизация |
| Assistant | -0.4438 | Слишком human-like может быть менее уместно |
Как это читать: TTS для ассистента, аудиокниги и персонажа нельзя ранжировать одним MOS. Evaluation должен явно задавать intended use, иначе модель может “улучшиться” по naturalness и стать хуже для продукта.