Multiresolution pyramids и Volterra kernels как интерпретируемое обучение сигналов
Это PhD thesis preprint, а не короткая модельная статья, зато он идеально попадает в линию DSP/wavelets. Главная мысль: deep learning для сигналов не обязан превращать все промежуточные представления в непрозрачные feature channels. Можно строить trainable systems, где переменные остаются связаны с kernels, subbands, recursions и transform-domain coefficients.
Что объединяет работа
Тезис собирает несколько signal-theoretic конструкций в differentiable modules: multiresolution analysis, wavelets и filter banks, multirate representations, nonlinear Volterra systems и neural computation graphs. Эти блоки обучаются backpropagation-ом, но сохраняют физически/математически читаемую структуру: scale, directional geometry, memory и nonlinear input-output interactions.
Какие модули формулируются
- Fast GPU-compatible D-dimensional convolution layers.
- Multirate sampling layers и wavelet banks.
- Volterra-kernel layers в natural и wavelet coefficient domains.
- Rational polynomial cascade heads.
- Stability-constrained multidimensional IIR filters.
- Digital shearlet layers with learnable gains.
Примеры применения
В microwave radiometric inversion система InVeRt восстанавливает вертикальные temperature и humidity profiles из microwave brightness observations с learnable Volterra kernels в wavelet bases. В классификации используются multiresolution filter-bank encoders с Volterra heads. Для segmentation появляются WaveletViT и ShearViT как subband transformer blocks для WaveNETR и ShearNETR. Отдельная линия MRILong посвящена 3D brain MRI segmentation и longitudinal analysis ischemic stroke MRI volumes.
Почему это стоит добавить к речевым обзорам
Для speech/audio это не готовая STT/TTS модель, но хороший фундаментальный материал. Речевые пайплайны снова приходят к filterbanks, multirate processing, neural codecs, differentiable DSP и structured front-ends. Такой thesis напоминает: можно делать обучаемые системы, где signal-processing prior не просто “предобработка”, а часть архитектуры, loss-а и интерпретации.
Фишка из статьи. Эта работа выглядит как “toolbox thesis” для нейросетевой обработки сигналов: вместо безымянных feature channels автор держит связь с фильтрами, поддиапазонами, рекурсиями, ядрами Volterra и коэффициентами преобразований. Поэтому ее интересно читать как каталог дифференцируемых DSP-слоев, а не как одну модель под один датасет.
| Модуль | Сигнальный объект | Почему это необычно |
|---|---|---|
| D-dimensional convolution layers | многомерные свертки | GPU-compatible реализация для обобщенных сигналов |
| Multirate sampling layers | decimation / interpolation | нейросеть явно работает с частотами дискретизации |
| Volterra layers | нелинейные ядра | модельирует слабые нелинейности как signal-processing оператор |
| Wavelet-domain Volterra | ядра в wavelet coefficients | нелинейность привязана к масштабу и поддиапазону |
| Rational polynomial cascade heads | рациональные аппроксимации | более структурная альтернатива обычному MLP-head |
| Stability-constrained IIR | рекурсивные фильтры | в сеть встроено ограничение устойчивости |
| Wavelet / shearlet banks | мультирезолюционные разложения | поддиапазоны становятся learnable строительными блоками |
Прикладная часть тоже широкая: InVeRt для microwave radiometric inversion, multiresolution filter-bank encoders, WaveletViT и ShearViT для WaveNETR/ShearNETR, а также MRILong для 3D T1 brain MRI segmentation и longitudinal stroke analysis. Для обзора это хорошая “мостовая” статья между DSP, wavelets и neural operators.