Wavelets Volterra Filter banks
Signal-theoretic ML

Multiresolution pyramids и Volterra kernels как интерпретируемое обучение сигналов

PhD thesis

Это PhD thesis preprint, а не короткая модельная статья, зато он идеально попадает в линию DSP/wavelets. Главная мысль: deep learning для сигналов не обязан превращать все промежуточные представления в непрозрачные feature channels. Можно строить trainable systems, где переменные остаются связаны с kernels, subbands, recursions и transform-domain coefficients.

Что объединяет работа

Тезис собирает несколько signal-theoretic конструкций в differentiable modules: multiresolution analysis, wavelets и filter banks, multirate representations, nonlinear Volterra systems и neural computation graphs. Эти блоки обучаются backpropagation-ом, но сохраняют физически/математически читаемую структуру: scale, directional geometry, memory и nonlinear input-output interactions.

Какие модули формулируются

  • Fast GPU-compatible D-dimensional convolution layers.
  • Multirate sampling layers и wavelet banks.
  • Volterra-kernel layers в natural и wavelet coefficient domains.
  • Rational polynomial cascade heads.
  • Stability-constrained multidimensional IIR filters.
  • Digital shearlet layers with learnable gains.

Примеры применения

В microwave radiometric inversion система InVeRt восстанавливает вертикальные temperature и humidity profiles из microwave brightness observations с learnable Volterra kernels в wavelet bases. В классификации используются multiresolution filter-bank encoders с Volterra heads. Для segmentation появляются WaveletViT и ShearViT как subband transformer blocks для WaveNETR и ShearNETR. Отдельная линия MRILong посвящена 3D brain MRI segmentation и longitudinal analysis ischemic stroke MRI volumes.

Почему это стоит добавить к речевым обзорам

Для speech/audio это не готовая STT/TTS модель, но хороший фундаментальный материал. Речевые пайплайны снова приходят к filterbanks, multirate processing, neural codecs, differentiable DSP и structured front-ends. Такой thesis напоминает: можно делать обучаемые системы, где signal-processing prior не просто “предобработка”, а часть архитектуры, loss-а и интерпретации.

Фишка из статьи. Эта работа выглядит как “toolbox thesis” для нейросетевой обработки сигналов: вместо безымянных feature channels автор держит связь с фильтрами, поддиапазонами, рекурсиями, ядрами Volterra и коэффициентами преобразований. Поэтому ее интересно читать как каталог дифференцируемых DSP-слоев, а не как одну модель под один датасет.

МодульСигнальный объектПочему это необычно
D-dimensional convolution layersмногомерные сверткиGPU-compatible реализация для обобщенных сигналов
Multirate sampling layersdecimation / interpolationнейросеть явно работает с частотами дискретизации
Volterra layersнелинейные ядрамодельирует слабые нелинейности как signal-processing оператор
Wavelet-domain Volterraядра в wavelet coefficientsнелинейность привязана к масштабу и поддиапазону
Rational polynomial cascade headsрациональные аппроксимацииболее структурная альтернатива обычному MLP-head
Stability-constrained IIRрекурсивные фильтрыв сеть встроено ограничение устойчивости
Wavelet / shearlet banksмультирезолюционные разложенияподдиапазоны становятся learnable строительными блоками

Прикладная часть тоже широкая: InVeRt для microwave radiometric inversion, multiresolution filter-bank encoders, WaveletViT и ShearViT для WaveNETR/ShearNETR, а также MRILong для 3D T1 brain MRI segmentation и longitudinal stroke analysis. Для обзора это хорошая “мостовая” статья между DSP, wavelets и neural operators.

Оригинальная статья на arXiv