Voice conversion Диктор Forensics
Речевая криминалистика

TRIDENT: восстановление исходного диктора после voice conversion

Top-1 90.99%

TRIDENT рассматривает важный криминалистический вопрос: можно ли восстановить исходного диктора после преобразования голоса, если преобразованная речь уже звучит как целевой диктор. Работа показывает, что в сигнале часто остается остаточный voiceprint источника, и его можно извлекать при наличии базы эталонных записей. Это не инструкция по обходу систем, а полезный анализ того, какие следы сохраняют современные методы voice conversion и как это влияет на защиту от подмены личности.

Метод. Модель строится как трехветочная система. Общая часть выделяет дикторские признаки, вспомогательная ветвь моделирует целевого диктора, чтобы подавлять его доминирующий вклад, а третья ветвь уточняет признаки источника. Обучение использует ограничения по косинусным расстояниям и классификационные потери, а оценка проводится по поиску исходного диктора в эталонной базе.

Результаты. На VoxCeleb и LibriSpeech с несколькими методами преобразования голоса TRIDENT получает в среднем 4.21% EER и 90.99% Top-1 accuracy на преобразованной речи; Top-3 достигает 97.29%, Top-5 - 98.76%. Для сравнения, близкий метод Revelio дает 6.22% EER и 78.91% Top-1. На настоящей, не преобразованной речи TRIDENT ожидаемо сильнее: 1.11% EER и 98.49% Top-1.

Ограничения. Метод требует эталонной базы и не может назвать источник, которого в базе нет; в таком случае он может только указывать на отсутствие уверенного совпадения. Результаты зависят от того, сохраняет ли конкретный voice conversion остаточные признаки исходного диктора. Есть и приватностный риск: такие методы полезны для экспертизы и защиты, но требуют строгого контроля доступа и сценариев применения.

Фишка из статьи. Самый практичный результат - зависимость от числа эталонных записей. Она показывает, что задача не бинарная: даже одна запись на диктора уже дает сигнал, но качество сильно растет с несколькими примерами.

Эталонов на диктораEERTop-1Top-3Top-5
17.81%79.82%91.01%94.71%
5около 4-5%выше 88%выше 96%выше 98%
202.85%95.87%99.14%99.68%

Как это читать: основное ограничение здесь не только в архитектуре, а в наличии надежной эталонной базы. Для реальной экспертизы прирост от дополнительных записей может быть важнее смены модели.

Оригинальная статья на arXiv