SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks
SlimDiffuSE сокращает цену диффузионного улучшения речи не за счёт меньшего числа шагов, а за счёт разной ширины одной сети на разных участках обратного процесса. Полная мощность нужна в начале, когда из шума формируется структура сигнала; ближе к чистой речи большую часть каналов можно отключить. В лучшем расписании это уменьшает число операций на 87,5% почти без потери PESQ и SI-SDR, но до реального времени работа пока не доведена.
Метод. Основа SGMSE+ работает с комплексным STFT и делает 30 шагов предиктора-корректора. NCSN++ превращается в сеть с тремя долями активных каналов: 1,0, 0,5 и 0,25; соответствующие свёртки, нормализации и внимание разделяют веса и обучаются совместно. Поиск начинает с полной ширины и постепенно заменяет поздние шаги более узкими, пока PESQ на проверочной выборке не ухудшится более чем на 0,1. Требование невозрастающей мощности уменьшает число проверок с 330, примерно 2,05·1014, до не более 60.
Результаты. Полная отдельная модель даёт PESQ 2,85 и SI-SDR 16,9 дБ при 125,4 GMAC на кадр. Полноширинная ветвь разделяемой сети получает 2,78 и 16,8 дБ. Найденное расписание оставляет полную ширину только на первом шаге, среднюю на шагах 2-6 и четверть каналов на шагах 7-30: 15,62 GMAC на кадр, PESQ 2,77 и SI-SDR 16,7 дБ. Отдельное сочетание трёх сетей тоже экономит 56%, но требует 89 млн параметров вместо 65 млн; единая изменяемая сеть убирает эту прибавку памяти.
Ограничения. Оценка проведена на 150 десятисекундных нереверберирующих записях DNS при 16 кГц и только автоматическими показателями. Нет прослушивания, времени выполнения, RTF, задержки или запуска на ограниченном устройстве. 65 млн параметров остаются тяжёлой моделью, а 30 шагов предиктора-корректора означают 60 последовательных обращений к сети, даже если большинство из них узкие. Расписание подбирается по PESQ на небольшой проверочной выборке и проверено только на одной архитектуре и одном шумовом наборе.
Фишка из статьи. Сами перестановки ширины дают почти причинную проверку гипотезы. Если широкую сеть поставить в начало обратной диффузии, конфигурации C1-C2 почти повторяют полный вариант; если тот же бюджет перенести в середину или конец, PESQ падает. Значит, экономия связана со стадией построения сигнала, а не просто со средним числом каналов.
| Расписание ширины | Средняя доля каналов | GMAC/кадр | PESQ | SI-SDR |
|---|---|---|---|---|
| Отдельная полная сеть | 1,000 | 125,40 | 2,85 | 16,9 дБ |
| Разделяемая сеть, всегда 1,0 | 1,000 | 125,40 | 2,78 | 16,8 дБ |
| 1 шаг 1,0; 5 шагов 0,5; 24 шага 0,25 | 0,317 | 15,62 | 2,77 | 16,7 дБ |
| 10 шагов каждой ширины | 0,542 | 50,90 | 2,77 | 16,8 дБ |
Как это читать: вычислительная цена падает в восемь раз, а PESQ относительно полноширинной ветви той же сети уменьшается всего на 0,01. Но GMAC на кадр ещё не задержка: последовательность из 60 вычислений и большая память могут оставить систему далёкой от потоковой работы.