Voice cloning как аугментация для паралингвистики
Статья задает правильный вопрос про синтетическую речь: сохраняет ли voice cloning не только разборчивость и похожесть диктора, но и паралингвистический сигнал, по которому решаются задачи вроде эмоций, акцента, сарказма, депрессии и тревожности. Это важно, потому что для клинической речи размеченные данные дороги, а перенос между языками обычно слабый. Авторы сравнивают восемь моделей клонирования и проверяют downstream AUC, а не только WER, MOS или speaker similarity.
Схема эксперимента достаточно строгая. Для признаков берут 1024-мерные WavLM Large embeddings и обучают Logistic Regression с L2, C=0.001 и balanced class weights. В публичной части используются IEMOCAP, MELD, MUSTARD и VCTK, а в клинической - английский проприетарный корпус 82 046 записей от 30 537 говорящих и японский корпус 14 159 записей от 6253 говорящих. Есть два режима: repeat, где синтез повторяет исходный текст, и standard, где все говорят один фиксированный текст, чтобы отделить содержание от паралингвистики.
В repeat-режиме сигнал в основном сохраняется: на публичных задачах Real mean AUC равен 0.785, E2-TTS дает 0.768, OpenAudio - 0.766, MaskGCT - 0.763. Медианная деградация по всем 176 model-task конфигурациям составляет 3.2 percentage points, а лучшие модели сохраняют более 90% above-chance сигнала. В standard-режиме качество ниже: лучшие средние AUC - MaskGCT 0.719 и E2-TTS 0.714, что показывает зависимость части задач от текста. В кросс-языковой клинической проверке английская речь, клонированная на японский, лучше сырого English-to-Japanese transfer: OpenAudio поднимает depression AUC с 0.593 до 0.626, CosyVoice 3 поднимает anxiety AUC с 0.578 до 0.618.
Ограничения не декоративные. Клинические корпуса закрытые, поэтому внешняя воспроизводимость ограничена. Записи обрезаются до 10 секунд; более длинные диалоги и спонтанная речь могут вести себя иначе. Поддержка японского есть не у всех моделей, поэтому кросс-языковая часть покрывает только четыре системы. И главное: сохранение паралингвистического сигнала не равно безопасной замене реальных данных, особенно для клинических задач с этическими и демографическими сдвигами.
Фишка из статьи. Интересно, что ranking моделей меняется между repeat и standard: высокая похожесть при повторе текста не гарантирует хорошее сохранение content-independent сигнала.
| Условие | Модель | Mean AUC на публичных задачах | Комментарий |
|---|---|---|---|
| Real | Original speech | 0.785 | Верхняя опора для сравнения |
| Repeat | E2-TTS | 0.768 | Лучшее сохранение при том же тексте |
| Repeat | OpenAudio | 0.766 | Почти тот же уровень |
| Standard | MaskGCT | 0.719 | Лучший фиксированный текст |
| Standard | OpenAudio | 0.693 | Падает сильнее, чем в repeat |
Как это читать: если синтетика повторяет исходные слова, модели могут сохранять и содержание, и голосовые признаки. Когда текст фиксируют, часть преимущества исчезает; значит, для паралингвистической аугментации нужно отдельно проверять, что именно переносится - голос, просодия, текст или их смесь.