Поддельный звук Устойчивость Вейвлеты
arXiv cs.SD

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

arXiv:2608.14249

AT-ADD расширяет обнаружение подделок от чистой речи к реальным каналам и сразу четырём типам звука: речи, окружающим событиям, пению и музыке. Это не новая единичная модель, а полезный срез соревнования: лучшие решения показывают, где универсальный детектор уступает маршрутизации по типу материала и насколько много дают имитация каналов, кодеков и воспроизведения.

Метод. Первая дорожка проверяет речь от 26 невидимых при обучении генераторов, записанную разными устройствами и искажённую скоростью, высотой тона, передискретизацией, кодеками и повторным воспроизведением. Вторая скрывает тип входа и добавляет четыре невидимых генератора звуков, пять генераторов пения и четыре генератора музыки. Условия закрытые: внешние наборы подделок запрещены. Победитель речи объединяет три W2V-BERT 2.0 с AASIST-подобными головами и широким моделированием условий. Третья система отдельно использует вейвлет-настройку подсказок для XLSR-1B, 4,04-секундные окна и робастную оптимизацию. Победитель общей дорожки сначала маршрутизирует запись замороженной BEATs, затем применяет специализированный детектор.

Результаты. На первой дорожке WaveShield получает Macro-F1 90,71%, опережая Fosafer с 86,67% и систему с вейвлет-настройкой с 86,63%. На второй дорожке маршрутизируемый ансамбль starfire достигает 96,10%, единая система orange9 - 95,58%, многопрофильная MEDS - 93,95%, а одиночная W2V-BERT-AASIST - 91,10%. Итоговая проверка велика: 146 346 речевых фрагментов в первой дорожке и 229 373 разнотипных во второй. Однако статья не даёт разбивок по типам, генераторам и искажениям, поэтому среднее место нельзя превратить в диагноз отдельных отказов.

Ограничения. Верх таблицы занимают ансамбли из трёх-пяти подсистем, многократные обрезки и пороги по типам, что усложняет перенос в реальное время. Набор закрытый и допускает только заданные ресурсы, поэтому рейтинг измеряет работу в конкретном протоколе. Часть progress-набора взята из того же распределения, что итоговая проверка, а Macro-F1 может скрывать слабый отдельный тип. Организаторы сами отмечают отсутствие детальных разрезов и недостаток сведений для воспроизводимости.

Фишка из статьи. На общей дорожке жёсткая маршрутизация выигрывает, но её преимущество над единой моделью невелико. Гораздо заметнее разрыв между сложными ансамблями и компактным одиночным детектором.

Система второй дорожкиОрганизацияПодсистемMacro-F1
starfireBEATs-маршрутизатор + ветви по типу496,10%
orange9единое слияние EAT и XLSR495,58%
ThreeTO MEDSчетыре специалиста + общая ветвь393,95%
KETI-KUодна W2V-BERT-AASIST191,10%

Как это читать: знание типа звука приносит победителю лишь 0,52 пункта относительно сильной единой системы, тогда как разница с одиночной моделью равна пяти пунктам. Без общей абляции нельзя приписать выигрыш именно маршрутизации: вместе с ней меняются ветви, пороги, обрезки и объединение оценок.

Оригинальная статья на arXiv