Voice cloning Clinical speech AUC
Паралингвистика

Voice cloning как аугментация для паралингвистики

AUC 0.626

Статья задает правильный вопрос про синтетическую речь: сохраняет ли voice cloning не только разборчивость и похожесть диктора, но и паралингвистический сигнал, по которому решаются задачи вроде эмоций, акцента, сарказма, депрессии и тревожности. Это важно, потому что для клинической речи размеченные данные дороги, а перенос между языками обычно слабый. Авторы сравнивают восемь моделей клонирования и проверяют downstream AUC, а не только WER, MOS или speaker similarity.

Схема эксперимента достаточно строгая. Для признаков берут 1024-мерные WavLM Large embeddings и обучают Logistic Regression с L2, C=0.001 и balanced class weights. В публичной части используются IEMOCAP, MELD, MUSTARD и VCTK, а в клинической - английский проприетарный корпус 82 046 записей от 30 537 говорящих и японский корпус 14 159 записей от 6253 говорящих. Есть два режима: repeat, где синтез повторяет исходный текст, и standard, где все говорят один фиксированный текст, чтобы отделить содержание от паралингвистики.

В repeat-режиме сигнал в основном сохраняется: на публичных задачах Real mean AUC равен 0.785, E2-TTS дает 0.768, OpenAudio - 0.766, MaskGCT - 0.763. Медианная деградация по всем 176 model-task конфигурациям составляет 3.2 percentage points, а лучшие модели сохраняют более 90% above-chance сигнала. В standard-режиме качество ниже: лучшие средние AUC - MaskGCT 0.719 и E2-TTS 0.714, что показывает зависимость части задач от текста. В кросс-языковой клинической проверке английская речь, клонированная на японский, лучше сырого English-to-Japanese transfer: OpenAudio поднимает depression AUC с 0.593 до 0.626, CosyVoice 3 поднимает anxiety AUC с 0.578 до 0.618.

Ограничения не декоративные. Клинические корпуса закрытые, поэтому внешняя воспроизводимость ограничена. Записи обрезаются до 10 секунд; более длинные диалоги и спонтанная речь могут вести себя иначе. Поддержка японского есть не у всех моделей, поэтому кросс-языковая часть покрывает только четыре системы. И главное: сохранение паралингвистического сигнала не равно безопасной замене реальных данных, особенно для клинических задач с этическими и демографическими сдвигами.

Фишка из статьи. Интересно, что ranking моделей меняется между repeat и standard: высокая похожесть при повторе текста не гарантирует хорошее сохранение content-independent сигнала.

УсловиеМодельMean AUC на публичных задачахКомментарий
RealOriginal speech0.785Верхняя опора для сравнения
RepeatE2-TTS0.768Лучшее сохранение при том же тексте
RepeatOpenAudio0.766Почти тот же уровень
StandardMaskGCT0.719Лучший фиксированный текст
StandardOpenAudio0.693Падает сильнее, чем в repeat

Как это читать: если синтетика повторяет исходные слова, модели могут сохранять и содержание, и голосовые признаки. Когда текст фиксируют, часть преимущества исчезает; значит, для паралингвистической аугментации нужно отдельно проверять, что именно переносится - голос, просодия, текст или их смесь.

Оригинальная статья на arXiv