Teffic-Audio: сильный baseline для детекции поддельной речи
Teffic-Audio интересна как аккуратный инженерный отчет о детекции поддельной речи: прирост достигается не экзотической архитектурой, а рецептом обучения и жесткой проверкой на разнородных наборах. Авторы берут Conformer-based encoder из w2v-BERT 2.0, multi-head attentive statistics pooling и бинарный классификатор, а основное внимание уделяют балансу атак, источников и аудио-аугментаций. Поэтому статью стоит читать как сильный reference system для практической проверки spoofing-детекторов.
Метод. Модель кодирует waveform через w2v-BERT 2.0 с 24 Conformer-блоками и размерностью 1024, затем агрегирует frame-level признаки через MHASP и MLP-классификатор. Обучающая смесь включает ASVspoof, FakeOrReal, SpeechFake, CodecFake и другие источники, а mini-batch балансируется по типу атаки и источнику данных. Ключевой компонент - diverse audio augmentation: RIR, фильтры, RawBoost, маскирование по времени, packet loss, MUSAN, codec compression и pitch shift.
Результаты. На Speech-DF-Arena, где 14 тестовых наборов сведены в общий leaderboard, Teffic-Audio получает pooled EER 1.454% и average EER 1.236% при 590M параметров. На отдельных наборах результат сильно различается: например, ITW - 1.321%, ASVspoof19 - 0.242%, ASVspoof24-E - 1.405%, ADD22 Track 1 - 7.031%, DFADD и LibriSeVoc - 0.000%. Это важно: общий EER низкий, но часть каналов и атак все еще заметно сложнее.
Ограничения. Система в таблице помечена как proprietary, хотя обучение заявлено только на open-source data, поэтому воспроизводимость ограничена. Модель большая, latency и real-time режим не анализируются, а leaderboard snapshot актуален на момент доступа авторов и может быстро меняться. Кроме того, статья показывает сильную обобщающую способность на выбранной батарее тестов, но не доказывает устойчивость к будущим генераторам речи.
Фишка из статьи. Абляция хорошо показывает, что просто смешать много датасетов мало. Решающий скачок дает не RawBoost сам по себе, а богатая аугментация, которая имитирует каналы, кодеки и акустические условия.
| Рецепт обучения | Pooled EER | Average EER | ASVspoof24-E EER | ADD22-T1 EER |
|---|---|---|---|---|
| Baseline: merged corpus + random sampling | 7.159% | 3.693% | 19.650% | 14.885% |
| + attack/source-balanced sampling | 6.456% | 3.539% | 17.840% | 14.730% |
| + supplementary bonafide corpus | 5.435% | 3.289% | 13.630% | 14.038% |
| + RawBoost augmentation | 5.896% | 3.081% | 17.814% | 13.794% |
| + diverse audio augmentation | 1.454% | 1.236% | 1.405% | 7.031% |
Как это читать: главный эффект не в том, что модель стала чуть лучше на одном наборе, а в резком падении ошибок на наборах, чувствительных к каналу и кодированию. Это хороший аргумент в пользу channel-aware обучения для детекции синтетической речи.