Речевые подделки Глухие участки речи Спектральные признаки
arXiv eess.AS

Investigating voiced and unvoiced regions of speech for audio deepfake detection

arXiv:2608.24639

Статья задаёт простой интерпретируемый вопрос: где именно синтезатор оставляет наиболее заметный для детектора след - в периодических гласных или в непериодических фрикативах и переходах. Неожиданно отдельная модель, видящая только глухие участки речи, почти вдвое снижает EER относительно модели по полной записи. Результат связывается с высокочастотными спектральными артефактами, которые слабо влияют на человеческое восприятие, но хорошо отделяют синтез от настоящей речи.

Метод. WebRTC VAD с жёсткостью 2 сначала удаляет тишину. pYIN оценивает основной тон и признак звонкости в окнах 80 мс с шагом 10 мс; двоичная маска сглаживается окном Хэмминга на 10 кадров, причём небольшое перекрытие сохраняет переходы. Четыре одинаковых AASIST обучаются отдельно по полной волне, только речевым кадрам, звонким кадрам и глухим кадрам. MLAAD делится так, что обучение и разработка содержат девять способов синтеза, а проверка - пять незнакомых: Bark, Capacitron, FastPitch, Overflow и Tortoise-TTS. В проверке 4 438 настоящих и 5 000 синтетических записей.

Результаты. Полная запись даёт EER 11,40%, речь без тишины - 10,10%, только звонкие участки - 12,26%, только глухие - 6,62%. Логистическое объединение звонкой и глухой моделей снижает EER до 5,82%, то есть на 49% относительно полного сигнала. Глухие участки занимают в среднем лишь 27% длительности. Для Capacitron их спектр хорошо отделён от настоящей речи в верхних частотах и FAR равен 1,6%, но у Tortoise-TTS спектр ближе к настоящему и FAR вырастает до 29,3%.

Ограничения. Сегментация pYIN рассчитана на сравнительно чистую речь и может ошибаться при шуме, реверберации, патологическом голосе и музыке. Вывод сделан по одному многоязычному набору и одной архитектуре AASIST; спектральный разрыв может отражать конкретный состав синтезаторов MLAAD. Четыре системы обучаются раздельно, а не как единая объяснимая модель. FastPitch и Overflow оказываются почти тривиальными атаками, поскольку это односпикерные модели на LJSpeech, что завышает средний выигрыш.

Фишка из статьи. Разбиение по звонкости раскрывает не только средний выигрыш, но и резко разные типы отказа.

Вход детектораEERFAR BarkFAR CapacitronFAR Tortoise-TTS
Полная запись11,40%10,9%6,3%39,8%
Только речь10,10%15,7%16,2%18,6%
Звонкие участки12,26%30,1%14,2%16,9%
Глухие участки6,62%2,1%1,6%29,3%
Объединение5,82%7,8%3,1%18,1%

Как это читать: глухие участки почти решают Bark и Capacitron, но плохо узнают Tortoise-TTS; звонкая ветвь частично компенсирует этот провал. Значит, полезен не универсальный «артефакт синтеза», а несколько взаимодополняющих акустических свидетельств.

Оригинальная статья на arXiv