Диффузионное улучшение речи Адаптивная ширина Вычислительная эффективность
arXiv eess.AS

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

arXiv:2608.21188

SlimDiffuSE сокращает цену диффузионного улучшения речи не за счёт меньшего числа шагов, а за счёт разной ширины одной сети на разных участках обратного процесса. Полная мощность нужна в начале, когда из шума формируется структура сигнала; ближе к чистой речи большую часть каналов можно отключить. В лучшем расписании это уменьшает число операций на 87,5% почти без потери PESQ и SI-SDR, но до реального времени работа пока не доведена.

Метод. Основа SGMSE+ работает с комплексным STFT и делает 30 шагов предиктора-корректора. NCSN++ превращается в сеть с тремя долями активных каналов: 1,0, 0,5 и 0,25; соответствующие свёртки, нормализации и внимание разделяют веса и обучаются совместно. Поиск начинает с полной ширины и постепенно заменяет поздние шаги более узкими, пока PESQ на проверочной выборке не ухудшится более чем на 0,1. Требование невозрастающей мощности уменьшает число проверок с 330, примерно 2,05·1014, до не более 60.

Результаты. Полная отдельная модель даёт PESQ 2,85 и SI-SDR 16,9 дБ при 125,4 GMAC на кадр. Полноширинная ветвь разделяемой сети получает 2,78 и 16,8 дБ. Найденное расписание оставляет полную ширину только на первом шаге, среднюю на шагах 2-6 и четверть каналов на шагах 7-30: 15,62 GMAC на кадр, PESQ 2,77 и SI-SDR 16,7 дБ. Отдельное сочетание трёх сетей тоже экономит 56%, но требует 89 млн параметров вместо 65 млн; единая изменяемая сеть убирает эту прибавку памяти.

Ограничения. Оценка проведена на 150 десятисекундных нереверберирующих записях DNS при 16 кГц и только автоматическими показателями. Нет прослушивания, времени выполнения, RTF, задержки или запуска на ограниченном устройстве. 65 млн параметров остаются тяжёлой моделью, а 30 шагов предиктора-корректора означают 60 последовательных обращений к сети, даже если большинство из них узкие. Расписание подбирается по PESQ на небольшой проверочной выборке и проверено только на одной архитектуре и одном шумовом наборе.

Фишка из статьи. Сами перестановки ширины дают почти причинную проверку гипотезы. Если широкую сеть поставить в начало обратной диффузии, конфигурации C1-C2 почти повторяют полный вариант; если тот же бюджет перенести в середину или конец, PESQ падает. Значит, экономия связана со стадией построения сигнала, а не просто со средним числом каналов.

Расписание шириныСредняя доля каналовGMAC/кадрPESQSI-SDR
Отдельная полная сеть1,000125,402,8516,9 дБ
Разделяемая сеть, всегда 1,01,000125,402,7816,8 дБ
1 шаг 1,0; 5 шагов 0,5; 24 шага 0,250,31715,622,7716,7 дБ
10 шагов каждой ширины0,54250,902,7716,8 дБ

Как это читать: вычислительная цена падает в восемь раз, а PESQ относительно полноширинной ветви той же сети уменьшается всего на 0,01. Но GMAC на кадр ещё не задержка: последовательность из 60 вычислений и большая память могут оставить систему далёкой от потоковой работы.

Оригинальная статья на arXiv