Эхоподавление DSP Lightweight
Эхоподавление

MSA-EchoLite: частотно-временное моделирование для легкого эхоподавления

0.20M params

Эта работа попадает ровно в практическую зону DSP для речи: акустическое эхоподавление должно работать быстро, но не терять частотно-временные детали после сжатия в Bark-представление. Авторы предлагают MSA-EchoLite, где классический адаптивный фильтр снимает линейное эхо, а маленькая нейросеть подавляет остаточное эхо и шум. Главный ход - добавить echo-aware modulation в компактный bottleneck, чтобы вернуть взаимодействие между микрофонным и эхосвязанным представлениями.

Метод. Система следует hybrid AEC: partitioned block frequency-domain adaptive filter оценивает линейное эхо, после чего Bark-domain U-Net получает микрофонный сигнал и echo-aligned reference. Ассиметричный encoder отдельно ведет microphone path и reference-filter path. EAM-блок строит взаимодействие между двумя латентными ветками и применяет свертки 3x3, 3x1 и 1x3, чтобы раздельно захватить совместные, временные и частотные связи перед FT-LSTM.

Результаты. В компактной конфигурации C32H64 EAM улучшает PESQ-WB с 2.02 до 2.10, ESTOI с 79.67% до 80.68%, SDR с 11.59 до 11.93 дБ и DegMOS с 3.84 до 3.94 при росте параметров с 0.15M до 0.20M. Частотная модель близка по качеству, но требует 196.26M FLOPs/s против 101.90M у Bark+EAM. На blind test AEC Challenge MSA-EchoLite дает EchoMOS 4.39/4.15/4.28/4.26 для clean/noisy/double-talk/far-end и ERLE 27.69 дБ.

Ограничения. Bark-представление экономит вычисления, но авторы сами показывают его чувствительность к сжатию признаков. Реальная оценка привязана к AEC Challenge и не раскрывает полный продуктовый профиль: задержку, устойчивость к новым устройствам, работу с нелинейным громкоговорителем и поведение при сильной near-end речи. RTF измерен на одном CPU thread и в процентах, так что перенос на мобильные DSP требует отдельного профилирования.

Фишка из статьи. Важна не только итоговая победа над baseline, а компромисс Bark против frequency-domain. EAM почти добирает качество частотной модели при заметно меньших FLOPs.

МодельПараметрыFLOPs/sPESQ-WBESTOISDREchoMOSDegMOS
Bark C32H640.15M80.83M2.0279.67%11.59 dB4.503.84
Bark C32H64 + EAM0.20M101.90M2.1080.68%11.93 dB4.543.94
Frequency C32H640.22M196.26M2.1280.93%11.71 dB4.603.96

Как это читать: +EAM стоит 26.1% дополнительных FLOPs относительно Bark-модели, но дает 99.1% PESQ частотного аналога и даже выше SDR. Для легкого эхоподавления это более важный результат, чем абсолютная победа по одной метрике.

Оригинальная статья на arXiv