Anonymization Child speech SSL
Voice privacy

Child voice anonymization: adult-trained pipelines нужно адаптировать под детскую речь

EER 45.09

Эта работа важна для voice privacy: многие voice anonymization pipelines обучаются и валидируются на взрослой речи, но применяются к детям, где акустика, дикция и возрастные признаки другие. Авторы проверяют, помогает ли domain adaptation SSL-компонентов именно для детской речи, и отдельно рассматривают single-speaker и multi-speaker сценарии.

Метод. В центре статьи — anonymization pipeline на SSL-представлениях, где можно адаптировать encoder, vocoder или обе части под child speech. Авторы сравнивают Base/Base, FT/Base, Base/FT и FT/FT, чтобы отделить эффект адаптации отдельных компонентов от согласованной адаптации всей цепочки. Для multi-speaker проверки они строят двухговорящие смеси: child speech из MyST test split, adult speech из LibriSpeech test-clean, 5 секунд, 0 dB SNR, overlap от 0 до 100% с шагом 20%, по 50 смесей на overlap и age-group pairing; всего 900 mixtures.

Результаты. На MyST component study полная адаптация FT/FT даёт EER 45.09, WER 16.64 и NISQA 3.36. Base/Base имеет EER 43.80, WER 17.31 и NISQA 3.60: privacy чуть ниже, naturalness выше. Асимметричная адаптация выглядит хуже: FT/Base снижает EER до 38.10 и повышает WER до 19.53, Base/FT даёт EER 40.68, WER 20.67 и NISQA 3.10. На SpeechOcean и MPS тенденция похожая: SSL-FT обычно повышает EER относительно baseline B2/SSL-B, но не всегда выигрывает по NISQA.

Ограничения. Это не универсальная гарантия приватности: EER зависит от выбранного speaker verification backend, а WER — от Whisper Large-v3 или gpt-4o-transcribe-diarize в соответствующем протоколе. Синтетические двухговорящие смеси с 0 dB SNR полезны для контроля overlap, но не полностью заменяют реальные детские записи в классе, доме или call-center. Ещё один практический компромисс: максимальная анонимизация может снижать perceived quality или возрастную естественность.

Фишка из статьи. Самая показательная часть — component ablation. Она демонстрирует, что адаптировать только encoder или только vocoder нельзя считать безопасным shortcut: рассогласование компонентов ухудшает одновременно privacy/intelligibility/quality trade-off.

КонфигурацияEER ↑WER ↓NISQA ↑Вывод
Base/Base43.8017.313.60Сильная базовая naturalness
FT/Base38.1019.533.70Адаптация encoder снижает privacy
Base/FT40.6820.673.10Адаптация vocoder ухудшает WER/NISQA
FT/FT45.0916.643.36Лучший privacy + intelligibility баланс

Как это читать: детская voice anonymization — не просто “прогнать через взрослый anonymizer”. Согласованная domain adaptation даёт лучший баланс EER и WER, но всё равно оставляет инженерный выбор между privacy, intelligibility и naturalness.

Оригинальная статья на arXiv