SBM: одношаговое улучшение речи через Schrödinger Bridge и Mamba
Эта статья попала в обзор как свежая замена на arXiv и как хорошая работа на стыке улучшения речи, дереверберации и потокового вывода. Авторы пытаются получить качество диффузионных и bridge-подходов без многократного сэмплирования: речь улучшается за один шаг. Главный ход - совместить Schrödinger Bridge formulation с Mamba-блоком, чтобы моделировать переход от зашумленной и реверберирующей речи к чистой при малом RTF.
Метод. В обычных generative speech enhancement схемах качество часто покупается числом шагов, что плохо для интерактивной обработки. Здесь обучение задает стохастический мост между распределениями noisy и clean speech, а вывод делается одношагово. Mamba используется как последовательный блок с меньшей стоимостью, чем attention- или LSTM-варианты; авторы также держат алгоритмическую задержку ниже 40 мс.
Результаты. На DNS With Reverb модель SBM с 3.93M параметров дает RTF 0.0048, SIG 3.653, BAK 3.995, OVRL 3.367, P808 4.055, NISQA 4.053, PESQ 1.971 и ESTOI 0.710. На VoiceBank SBM получает PESQ 3.503 и ESTOI 0.891 при том же RTF; ZipEnhancer выше по PESQ 3.628, но его RTF 0.105, то есть примерно на порядок тяжелее. Важно, что статья не утверждает абсолютную победу по всем intrusive метрикам, а показывает сильный режим качество/скорость.
Ограничения. Работа во многом опирается на объективные и reference-free показатели; субъективного прослушивания нет. На некоторых наборах более тяжелые методы сохраняют преимущество по PESQ или ESTOI, поэтому SBM лучше читать как low-latency компромисс, а не как универсально лучший enhancer. Также остается вопрос переноса на реальные комнаты, микрофонные массивы и потоковые клиентские устройства.
Фишка из статьи. Самая показательная абляция - не сравнение с внешними моделями, а замена learning paradigm внутри разных backbones. Schrödinger Bridge улучшает MHSA, LSTM и Mamba, но Mamba(SB) дает лучший баланс параметров и качества на реальных DNS-записях.
| Вариант DNS Real | Параметры | SIG | BAK | OVRL | NISQA |
|---|---|---|---|---|---|
| MHSA(M) | 8.37M | 2.975 | 3.809 | 2.676 | 2.358 |
| MHSA(SB) | 8.41M | 3.221 | 3.941 | 2.927 | 3.240 |
| LSTM(M) | 17.38M | 3.083 | 3.904 | 2.799 | 2.585 |
| LSTM(SB) | 17.42M | 3.289 | 3.965 | 3.000 | 3.819 |
| Mamba(M) | 3.61M | 3.284 | 3.974 | 2.993 | 3.644 |
| Mamba(SB) | 3.93M | 3.459 | 4.106 | 3.198 | 3.937 |
Как это читать: SB-обучение дает прирост у каждого backbone, но Mamba оказывается самым экономным носителем этого выигрыша. Для речевого улучшения в реальном времени это важнее, чем одиночная победа по PESQ на офлайн-наборе.