DDSP для adaptive room equalization: частотный loss вместо Fx-LMS-рутины
Авторы переупаковывают adaptive room equalization как differentiable DSP-задачу: вместо того чтобы оставаться только в мире Fx-LMS, они строят модульный PyTorch-фреймворк с параметрическими EQ, частотными loss-функциями и современными оптимизаторами. Для звука это близко к теме real-time DSP, но с удобством обучения через autograd.
Что сделали. Фреймворк восстанавливает Fx-LMS как частный случай через automatic differentiation, но позволяет менять фильтры, losses и optimizer. Эксперименты идут на time-varying room impulse responses из SoundCam и 10 music mixes из MedleyDB, то есть задача ближе к живому помещению, чем к статичной лабораторной коррекции.
Результат. Frequency-domain MSE оказался стабильнее time-domain MSE, а iHAM-3 дал лучший normalized system distance в одном из режимов: MSD 4.12 при 15-секундном transition. Авторы также отмечают, что 8192-сэмпловые фреймы на 48 кГц дают удачный баланс между convergence и responsiveness.
Практический смысл. Это хороший пример того, как DDSP можно использовать не для синтеза тембра, а для инженерной акустической адаптации. Ограничение ожидаемое: более сильные оптимизаторы вроде Newton или iHAM-3 стоят дороже по compute, поэтому production-выбор будет зависеть от latency и доступного железа.
Фишка из статьи. Самая красивая часть DDSP Room EQ - авторы не выбрасывают классический adaptive filtering, а показывают, что Fx-LMS получается как частный случай differentiable DSP-формулировки через autograd. Дальше в эту же рамку можно подставлять parametric EQ, frequency-domain losses и оптимизаторы вроде iHAM.
| Метод | 15 s MSD | 15 s SCE | Mean frame time | Комментарий |
|---|---|---|---|---|
| Fx-LMS | NC | NC | 200.83 ms | Не сошелся и превышает 170 ms frame budget. |
| Fx-FDAF | 4.82 | 500.91 Hz | 16.57 ms | Быстрый FIR baseline, но хуже по спектральным метрикам. |
| Adam | 4.27 | 221.34 Hz | 19.96 ms | Быстрый, но были instability cases на 30 s transitions. |
| Newton | 4.51 | 220.51 Hz | 140.15 ms | Лучше держит spectral balance, но дорогой. |
| iHAM-3 | 4.12 | 237.94 Hz | 141.35 ms | Лучший MSD, но с небольшим compute headroom. |
Как это читать: parametric EQ с 22 параметрами в этой постановке выглядит не игрушкой, а сильной structured alternative к длинным FIR baseline. Frequency-domain MSE стабилизирует adaptation на музыке, но тяжелые оптимизаторы уже близко подходят к real-time бюджету.