DDSP Room EQ iHAM
Room acoustics

DDSP для adaptive room equalization: частотный loss вместо Fx-LMS-рутины

MSD 4.12

Авторы переупаковывают adaptive room equalization как differentiable DSP-задачу: вместо того чтобы оставаться только в мире Fx-LMS, они строят модульный PyTorch-фреймворк с параметрическими EQ, частотными loss-функциями и современными оптимизаторами. Для звука это близко к теме real-time DSP, но с удобством обучения через autograd.

Что сделали. Фреймворк восстанавливает Fx-LMS как частный случай через automatic differentiation, но позволяет менять фильтры, losses и optimizer. Эксперименты идут на time-varying room impulse responses из SoundCam и 10 music mixes из MedleyDB, то есть задача ближе к живому помещению, чем к статичной лабораторной коррекции.

Результат. Frequency-domain MSE оказался стабильнее time-domain MSE, а iHAM-3 дал лучший normalized system distance в одном из режимов: MSD 4.12 при 15-секундном transition. Авторы также отмечают, что 8192-сэмпловые фреймы на 48 кГц дают удачный баланс между convergence и responsiveness.

Практический смысл. Это хороший пример того, как DDSP можно использовать не для синтеза тембра, а для инженерной акустической адаптации. Ограничение ожидаемое: более сильные оптимизаторы вроде Newton или iHAM-3 стоят дороже по compute, поэтому production-выбор будет зависеть от latency и доступного железа.

Фишка из статьи. Самая красивая часть DDSP Room EQ - авторы не выбрасывают классический adaptive filtering, а показывают, что Fx-LMS получается как частный случай differentiable DSP-формулировки через autograd. Дальше в эту же рамку можно подставлять parametric EQ, frequency-domain losses и оптимизаторы вроде iHAM.

Метод15 s MSD15 s SCEMean frame timeКомментарий
Fx-LMSNCNC200.83 msНе сошелся и превышает 170 ms frame budget.
Fx-FDAF4.82500.91 Hz16.57 msБыстрый FIR baseline, но хуже по спектральным метрикам.
Adam4.27221.34 Hz19.96 msБыстрый, но были instability cases на 30 s transitions.
Newton4.51220.51 Hz140.15 msЛучше держит spectral balance, но дорогой.
iHAM-34.12237.94 Hz141.35 msЛучший MSD, но с небольшим compute headroom.

Как это читать: parametric EQ с 22 параметрами в этой постановке выглядит не игрушкой, а сильной structured alternative к длинным FIR baseline. Frequency-domain MSE стабилизирует adaptation на музыке, но тяжелые оптимизаторы уже близко подходят к real-time бюджету.

Оригинальная статья на arXiv