DP-Foley: компактная waveform diffusion для Foley-звуков
DP-Foley интересна как работа на границе генерации аудио и эффективности: авторы пытаются делать Foley-звуки прямо в waveform-представлении, но без огромной модели. Они добавляют dual-path внимание по времени и частоте и отдельно задают класс звука и контур энергии. В результате небольшие модели на 3-9 млн параметров обходят более крупные Foley-базовые системы по объективным и субъективным метрикам, хотя до реального времени им еще далеко.
Метод. Рассматриваются две архитектуры: DP-DiT и DP-U-Net. Обе работают с 4-секундными фрагментами 22,050 Гц, используют STFT-представление формы 352 x 256 и conditioning по классу события и временному RMS energy. Dual-path блоки разделяют внимание вдоль временной и частотной осей, чтобы не гонять полное дорогое внимание по всей сетке. Модели обучаются 500 эпох с AdamW, 200 шагами денойзинга, linear noise schedule от 1e-4 до 2e-2 и classifier-free guidance scale 1.2.
Результаты. На DCASE DP-U-Net дает E-L1 0.009, FAD-P 27.48 и FAD-V 5.34; DP-U-Net Small почти не отстает по FAD-P 27.98 при 3.26 млн параметров. На FSD-Kaggle2018 DP-U-Net получает E-L1 0.006, FAD-P 62.77, FAD-V 11.55. В субъективной оценке по пятибалльной шкале DP-U-Net набирает 4.07 по качеству и 4.47 по временной согласованности, DP-DiT 3.97 и 4.46, тогда как Mamba-Foley 3.25 и 3.66, T-Foley 2.53 и 3.04. В вычислениях DP-U-Net Small имеет RTF 3.20 и 78.38 GFLOPs, что заметно легче DP-U-Net, но все еще медленнее реального времени.
Ограничения. Это не синтез речи и не универсальная text-to-audio система: постановка ориентирована на Foley с классом звука и заданным энергетическим контуром. Субъективная панель мала, всего 9 участников. RTF больше 1, значит даже компактная версия не подходит для строгого интерактива без оптимизации. RMS-контур берется как условие, поэтому часть временной структуры дана модели заранее, а не полностью сгенерирована из текста.
Фишка из статьи. Интереснее всего компромисс между качеством и размером: маленький DP-U-Net Small почти сохраняет качество полной DP-U-Net, но требует меньше параметров и вычислений. Это важнее простой фразы "модель лучше baseline", потому что для аудиоинструментов стоимость вывода часто критична.
| Модель | Параметры | DCASE FAD-P | RTF | Память |
|---|---|---|---|---|
| Mamba-Foley | 58.81M | 29.65 | 4.05 | 0.44 GB |
| DP-U-Net | 8.57M | 27.48 | 4.37 | 1.22 GB |
| DP-U-Net Small | 3.26M | 27.98 | 3.20 | 1.15 GB |
| DiffWave | 12.58M | 52.00 | 6.24 | 9.74 GB |
Как это читать: DP-U-Net Small почти совпадает с полной DP-U-Net по DCASE FAD-P, 27.98 против 27.48, но имеет 3.26M параметров вместо 8.57M и лучший RTF 3.20 против 4.37. Это не real-time, но уже практичный шаг для waveform diffusion, где вычисления обычно быстро становятся узким местом.