Deepfake Conformer Аугментации
Детекция поддельной речи

Teffic-Audio: сильный baseline для детекции поддельной речи

EER 1.454%

Teffic-Audio интересна как аккуратный инженерный отчет о детекции поддельной речи: прирост достигается не экзотической архитектурой, а рецептом обучения и жесткой проверкой на разнородных наборах. Авторы берут Conformer-based encoder из w2v-BERT 2.0, multi-head attentive statistics pooling и бинарный классификатор, а основное внимание уделяют балансу атак, источников и аудио-аугментаций. Поэтому статью стоит читать как сильный reference system для практической проверки spoofing-детекторов.

Метод. Модель кодирует waveform через w2v-BERT 2.0 с 24 Conformer-блоками и размерностью 1024, затем агрегирует frame-level признаки через MHASP и MLP-классификатор. Обучающая смесь включает ASVspoof, FakeOrReal, SpeechFake, CodecFake и другие источники, а mini-batch балансируется по типу атаки и источнику данных. Ключевой компонент - diverse audio augmentation: RIR, фильтры, RawBoost, маскирование по времени, packet loss, MUSAN, codec compression и pitch shift.

Результаты. На Speech-DF-Arena, где 14 тестовых наборов сведены в общий leaderboard, Teffic-Audio получает pooled EER 1.454% и average EER 1.236% при 590M параметров. На отдельных наборах результат сильно различается: например, ITW - 1.321%, ASVspoof19 - 0.242%, ASVspoof24-E - 1.405%, ADD22 Track 1 - 7.031%, DFADD и LibriSeVoc - 0.000%. Это важно: общий EER низкий, но часть каналов и атак все еще заметно сложнее.

Ограничения. Система в таблице помечена как proprietary, хотя обучение заявлено только на open-source data, поэтому воспроизводимость ограничена. Модель большая, latency и real-time режим не анализируются, а leaderboard snapshot актуален на момент доступа авторов и может быстро меняться. Кроме того, статья показывает сильную обобщающую способность на выбранной батарее тестов, но не доказывает устойчивость к будущим генераторам речи.

Фишка из статьи. Абляция хорошо показывает, что просто смешать много датасетов мало. Решающий скачок дает не RawBoost сам по себе, а богатая аугментация, которая имитирует каналы, кодеки и акустические условия.

Рецепт обученияPooled EERAverage EERASVspoof24-E EERADD22-T1 EER
Baseline: merged corpus + random sampling7.159%3.693%19.650%14.885%
+ attack/source-balanced sampling6.456%3.539%17.840%14.730%
+ supplementary bonafide corpus5.435%3.289%13.630%14.038%
+ RawBoost augmentation5.896%3.081%17.814%13.794%
+ diverse audio augmentation1.454%1.236%1.405%7.031%

Как это читать: главный эффект не в том, что модель стала чуть лучше на одном наборе, а в резком падении ошибок на наборах, чувствительных к каналу и кодированию. Это хороший аргумент в пользу channel-aware обучения для детекции синтетической речи.

Оригинальная статья на arXiv