Investigating voiced and unvoiced regions of speech for audio deepfake detection
Статья задаёт простой интерпретируемый вопрос: где именно синтезатор оставляет наиболее заметный для детектора след - в периодических гласных или в непериодических фрикативах и переходах. Неожиданно отдельная модель, видящая только глухие участки речи, почти вдвое снижает EER относительно модели по полной записи. Результат связывается с высокочастотными спектральными артефактами, которые слабо влияют на человеческое восприятие, но хорошо отделяют синтез от настоящей речи.
Метод. WebRTC VAD с жёсткостью 2 сначала удаляет тишину. pYIN оценивает основной тон и признак звонкости в окнах 80 мс с шагом 10 мс; двоичная маска сглаживается окном Хэмминга на 10 кадров, причём небольшое перекрытие сохраняет переходы. Четыре одинаковых AASIST обучаются отдельно по полной волне, только речевым кадрам, звонким кадрам и глухим кадрам. MLAAD делится так, что обучение и разработка содержат девять способов синтеза, а проверка - пять незнакомых: Bark, Capacitron, FastPitch, Overflow и Tortoise-TTS. В проверке 4 438 настоящих и 5 000 синтетических записей.
Результаты. Полная запись даёт EER 11,40%, речь без тишины - 10,10%, только звонкие участки - 12,26%, только глухие - 6,62%. Логистическое объединение звонкой и глухой моделей снижает EER до 5,82%, то есть на 49% относительно полного сигнала. Глухие участки занимают в среднем лишь 27% длительности. Для Capacitron их спектр хорошо отделён от настоящей речи в верхних частотах и FAR равен 1,6%, но у Tortoise-TTS спектр ближе к настоящему и FAR вырастает до 29,3%.
Ограничения. Сегментация pYIN рассчитана на сравнительно чистую речь и может ошибаться при шуме, реверберации, патологическом голосе и музыке. Вывод сделан по одному многоязычному набору и одной архитектуре AASIST; спектральный разрыв может отражать конкретный состав синтезаторов MLAAD. Четыре системы обучаются раздельно, а не как единая объяснимая модель. FastPitch и Overflow оказываются почти тривиальными атаками, поскольку это односпикерные модели на LJSpeech, что завышает средний выигрыш.
Фишка из статьи. Разбиение по звонкости раскрывает не только средний выигрыш, но и резко разные типы отказа.
| Вход детектора | EER | FAR Bark | FAR Capacitron | FAR Tortoise-TTS |
|---|---|---|---|---|
| Полная запись | 11,40% | 10,9% | 6,3% | 39,8% |
| Только речь | 10,10% | 15,7% | 16,2% | 18,6% |
| Звонкие участки | 12,26% | 30,1% | 14,2% | 16,9% |
| Глухие участки | 6,62% | 2,1% | 1,6% | 29,3% |
| Объединение | 5,82% | 7,8% | 3,1% | 18,1% |
Как это читать: глухие участки почти решают Bark и Capacitron, но плохо узнают Tortoise-TTS; звонкая ветвь частично компенсирует этот провал. Значит, полезен не универсальный «артефакт синтеза», а несколько взаимодополняющих акустических свидетельств.