AT-ADD: All-Type Audio Deepfake Detection Challenge Summary
AT-ADD расширяет обнаружение подделок от чистой речи к реальным каналам и сразу четырём типам звука: речи, окружающим событиям, пению и музыке. Это не новая единичная модель, а полезный срез соревнования: лучшие решения показывают, где универсальный детектор уступает маршрутизации по типу материала и насколько много дают имитация каналов, кодеков и воспроизведения.
Метод. Первая дорожка проверяет речь от 26 невидимых при обучении генераторов, записанную разными устройствами и искажённую скоростью, высотой тона, передискретизацией, кодеками и повторным воспроизведением. Вторая скрывает тип входа и добавляет четыре невидимых генератора звуков, пять генераторов пения и четыре генератора музыки. Условия закрытые: внешние наборы подделок запрещены. Победитель речи объединяет три W2V-BERT 2.0 с AASIST-подобными головами и широким моделированием условий. Третья система отдельно использует вейвлет-настройку подсказок для XLSR-1B, 4,04-секундные окна и робастную оптимизацию. Победитель общей дорожки сначала маршрутизирует запись замороженной BEATs, затем применяет специализированный детектор.
Результаты. На первой дорожке WaveShield получает Macro-F1 90,71%, опережая Fosafer с 86,67% и систему с вейвлет-настройкой с 86,63%. На второй дорожке маршрутизируемый ансамбль starfire достигает 96,10%, единая система orange9 - 95,58%, многопрофильная MEDS - 93,95%, а одиночная W2V-BERT-AASIST - 91,10%. Итоговая проверка велика: 146 346 речевых фрагментов в первой дорожке и 229 373 разнотипных во второй. Однако статья не даёт разбивок по типам, генераторам и искажениям, поэтому среднее место нельзя превратить в диагноз отдельных отказов.
Ограничения. Верх таблицы занимают ансамбли из трёх-пяти подсистем, многократные обрезки и пороги по типам, что усложняет перенос в реальное время. Набор закрытый и допускает только заданные ресурсы, поэтому рейтинг измеряет работу в конкретном протоколе. Часть progress-набора взята из того же распределения, что итоговая проверка, а Macro-F1 может скрывать слабый отдельный тип. Организаторы сами отмечают отсутствие детальных разрезов и недостаток сведений для воспроизводимости.
Фишка из статьи. На общей дорожке жёсткая маршрутизация выигрывает, но её преимущество над единой моделью невелико. Гораздо заметнее разрыв между сложными ансамблями и компактным одиночным детектором.
| Система второй дорожки | Организация | Подсистем | Macro-F1 |
|---|---|---|---|
| starfire | BEATs-маршрутизатор + ветви по типу | 4 | 96,10% |
| orange9 | единое слияние EAT и XLSR | 4 | 95,58% |
| ThreeTO MEDS | четыре специалиста + общая ветвь | 3 | 93,95% |
| KETI-KU | одна W2V-BERT-AASIST | 1 | 91,10% |
Как это читать: знание типа звука приносит победителю лишь 0,52 пункта относительно сильной единой системы, тогда как разница с одиночной моделью равна пяти пунктам. Без общей абляции нельзя приписать выигрыш именно маршрутизации: вместе с ней меняются ветви, пороги, обрезки и объединение оценок.