TTS MOS Appropriateness
TTS evaluation

TTS evaluation: naturalness не равна appropriateness для разных доменов

ρ −0.4438

Статья полезна тем, что атакует привычный shortcut в TTS evaluation: высокий naturalness/MOS не означает, что голос подходит для конкретного сценария. Авторы сравнивают пять сильных TTS-систем в пяти доменах — AI assistant, reader, actor, animated character и spontaneous speaker — и показывают, что “человечность” и contextual appropriateness могут расходиться вплоть до отрицательной корреляции.

Метод. В perceptual study участвуют Kokoro, Gemini TTS, Kyutai-TTS, GPT-4o-mini-tts и ElevenLabs, выбранные как сильные и стилистически разные системы; чтобы снизить voice-preference bias, использованы female voices с похожим timbre. Оцениваются appropriateness и human-likeness по доменам и речевым задачам. Дополнительно авторы считают акустические признаки: rhythm, articulation/speech rate, nPVI, F0 range, jitter/shimmer, CPPS, arousal/valence, а также automatic metrics вроде UTMOSv2, DNSMOS, SQuIM, PESQ, STOI, WER, AudioBox metrics и WavLM-style distances.

Результаты. Системы хорошо выглядят в reading/assistant-style задачах, но expressive domains остаются сложнее. Kokoro подходит для reading и assistant, но слабее в conversational tasks; Kyutai-TTS воспринимается естественно и уместно для spontaneous conversation, но хуже подходит для assistant и animated character. Inter-rater agreement низкий: Krippendorff alpha 0.2 для TTS samples и 0.44 для ground truth, то есть appropriateness субъективна. Ключевое число: корреляция human-likeness и appropriateness положительна для Actor (ρ=0.4705), Spontaneous (ρ=0.4021), Reader (ρ=0.3757), почти нулевая для Animated Character (ρ=0.0821) и отрицательная для Assistant (ρ=-0.4438).

Ограничения. Это perceptual study с ограниченным набором систем, голосов и доменов; все голоса намеренно сведены к похожему female timbre, поэтому выводы не покрывают gender/style diversity. Низкое agreement — не только недостаток, но и сигнал, что задача действительно субъективна. Автоматические метрики перечислены широко, однако статья скорее показывает blind spots, чем предлагает один новый финальный скорер.

Фишка из статьи. Самый интересный результат — доменный знак корреляции. Для assistant-сценария более human-like голос может восприниматься менее appropriate, тогда как для actor/spontaneous domains human-likeness обычно помогает.

ДоменSpearman ρ: human-likeness vs appropriatenessПрактический смысл
Spontaneous0.4021Естественность помогает conversational fit
Actor0.4705Выразительность и human-likeness согласованы
Reader0.3757Натуральность умеренно совпадает с уместностью
Animated character0.0821Почти нет связи: нужна стилизация
Assistant-0.4438Слишком human-like может быть менее уместно

Как это читать: TTS для ассистента, аудиокниги и персонажа нельзя ранжировать одним MOS. Evaluation должен явно задавать intended use, иначе модель может “улучшиться” по naturalness и стать хуже для продукта.

Оригинальная статья на arXiv