звуковая криминалистика фазовые признаки синтез звука
arXiv cs.SD

Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds

arXiv:2608.26346

Работа ищет следы синтеза не в амплитудном спектре, а в фазовой структуре затухания ударных звуков: взрывов, хлопков и столкновений. Групповая задержка особенно интересна здесь потому, что генератор может правдоподобно воспроизвести атаку и спектральную огибающую, но хуже согласует поздние отражения и фазу между частотными полосами.

Метод. Для каждого трёхсекундного отрывка 16 кГц авторы разворачивают фазу STFT, берут её конечную разность по частоте, ограничивают задержку диапазоном ±500 отсчётов и переводят карту в 128 мел-полос размером 128 × 188. Проверяются как девять интерпретируемых статистик с Random Forest, так и ResNet, EfficientNet, CNN14 и AST, обученные только по картам групповой задержки. Корпус содержит 15 000 примеров поровну из FSD50K/SESA и ElevenLabs/Stable Audio/AudioLDM2.

Результаты. Расхождение распределений реальных и синтетических данных по KL равно лишь 0,022 в области атаки, но 0,322 в области затухания. Одна межполосная мера даёт AUC 0,720, девять статистик — 0,884, а CNN14 на обычном разделении достигает точности 94,20%. Результат сохраняется при 27 настройках STFT: AUC леса лежит от 0,700 до 0,847 со стандартным отклонением 0,035.

Ограничения. Все звуки импульсные, длина фиксирована, а генераторов всего три. Реальные источники различимы между собой с AUC 0,737, поэтому часть сигнала может отражать происхождение набора. При исключении целого генератора качество резко меняется; устойчивость к перекодированию, фазовому возмущению и новым типам звука не проверена.

Фишка из статьи. Исключение одного генератора раскрывает более важный результат, чем высокая точность случайного разделения: фазовый след не универсален. AudioLDM2 переносится особенно плохо, причём CNN14 оказывается ниже случайного уровня, тогда как простой набор статистик хотя бы не переобучается столь резко.

Исключённый генераторRandom Forest, AUCCNN14, AUCAST, AUC
AudioLDM20,5800,4570,659
Stable Audio0,8320,9180,906
ElevenLabs0,7820,8060,753

Как это читать: стандартное смешанное разделение завышает ощущение готовности детектора. Полезный вывод статьи — область затухания действительно несёт фазовый признак, но его форма зависит от генератора, поэтому для практической проверки нужны разнообразные неизвестные системы и калибровка по источникам.

Оригинальная статья на arXiv