Генерация аудио Сжатие модели AudioLDM
Генерация аудио

Сжатие AudioLDM: меньше U-Net без потери качества

-83% params

Статья показывает, что в U-Net части AudioLDM есть большой запас избыточности: фильтры можно агрессивно обрезать, а затем частично восстановить качество легким дообучением. Интерес не только в ускорении текст-в-аудио генерации, но и в диагностике: какие типы звуков исчезают первыми, когда модель сжимают. Для прикладного аудио это важнее, чем один средний FAD.

Метод. Авторы анализируют блоки U-Net в AudioLDM-M-Full: исходная конфигурация имеет 416M параметров и 102.94G MACs. Больше всего параметров сидит в глубоких блоках b3 и b4, поэтому именно там применяют filter pruning по l1-норме фильтров. После обрезки дообучается только U-Net на AudioCaps, а VAE и CLAP остаются замороженными. Оценка идет на AudioCaps test, генерация выполняется за 200 шагов.

Результаты. Уменьшение b4 с 5 до 1 снижает число параметров с 416M до 145M, то есть примерно на 65%, а MACs с 102.94G до 83.79G. Самый компактный вариант (1,2,1,1) оставляет 70.49M параметров и 63G MACs: минус 83% параметров и минус 39% вычислений. После дообучения он получает FAD 1.57 и KL 1.778 против FAD 3.95 и KL 2.16 у исходной модели. Real-time factor тоже снижается: 2.14 у исходной модели против примерно 1.86-1.88 у сжатых вариантов.

Ограничения. Основная оценка автоматическая: FAD, KL и event recall через PANNs, без большого субъективного теста. Дообучение все равно длительное, 1M шагов. Работа сфокусирована на AudioLDM и AudioCaps, поэтому нельзя автоматически переносить числа на другие генераторы, более длинные сцены или музыку. Кроме того, средние метрики скрывают важные потери редких событий.

Фишка из статьи. Самая полезная таблица показывает, что сжатие ломает не все звуки одинаково. Речь и человеческие звуки устойчивее, а safety-critical и mechanical события теряются гораздо чаще.

Семейство событийОбнаружено в исходной моделиПотеря после pruningВосстановлено после FTПримеры
Safety-critical3473.5%76.0%gunshot 8/7, siren 7/5
Mechanical2475.0%83.3%drill 5/4, engine 3/3
Speech & Human35813.1%74.5%speech 34/29
Vehicles31028.4%75.0%car 10/9, boat 9/9

Как это читать: компактная модель может выглядеть хорошо по FAD, но потерять редкие и важные события. Поэтому для сжатия генераторов аудио нужна проверка по семантическим семействам, а не только усредненная метрика качества.

Оригинальная статья на arXiv