разложение сигналов адаптивный спектр обработка сигналов
arXiv eess.SP

IDSD: Iterative Deep-Learning-Based Signal Decomposition

arXiv:2608.27332

IDSD переносит идею адаптивного разложения сигнала в обучаемую итерационную схему: сеть не выдаёт заранее заданное число компонент, а поочерёдно извлекает их из остатка. Это интересно как мост между классическими EMD/VMD-подобными постановками и нейросетевыми частотно-временными представлениями, особенно когда число мод в сигнале заранее неизвестно.

Метод. U-Net получает неотрицательный спектр Фурье текущего остатка, строит маску следующей компоненты, после чего остаток обновляется и цикл повторяется до критерия остановки. Компоненты складываются обратно без ошибки реконструкции; обучение задаёт порядок извлечения и отделяет близкие моды. Авторы сравнивают маскирование спектра с прямым предсказанием временных сигналов, многослойным перцептроном и вариантами с фиксированным числом шагов.

Результаты. U-Net C128 с масками даёт среднюю ошибку 0,173 для двух и 0,252 для пяти компонент, тогда как прямое предсказание во временной области получает 0,404 и 0,830. Даже компактный C32 на 124 тыс. параметров достигает 0,187 и 0,331. Обучение с переменным числом компонент особенно важно на сложных смесях: фиксированный режим K=1 ухудшает ошибку для пяти компонент до 0,420.

Ограничения. Проверка в основном построена на синтетических сигналах, приливных рядах и фотоплетизмограммах; речи и музыки в опытах нет. Спектральная сетка привязывает поведение к длине окна, а очень длинные записи требуют отдельного решения для памяти и разрешения. Поэтому работа показывает общий механизм разложения, но ещё не доказывает его пользу в речевом тракте.

Фишка из статьи. Самый содержательный результат здесь не абсолютная ошибка, а устойчивость к неизвестному числу мод.

Режим обученияОшибка, 2 компонентыОшибка, 5 компонент
Переменное K0,1730,252
Фиксированное K=10,1840,420
Фиксированное K=20,1750,284
Фиксированное K=50,2610,256

Как это читать: настройка на пять шагов почти не выигрывает на пятикомпонентном сигнале, но заметно портит простой двухкомпонентный случай. Итерационная остановка нужна не для красоты: она позволяет одному разлагателю работать при разной сложности сигнала.

Оригинальная статья на arXiv