Enhancement Binaural Low-latency
Speech enhancement

RT-Tango: binaural speech enhancement для hearing aids с 8 ms latency

8 ms

RT-Tango интересна как системная работа по speech enhancement не “в вакууме”, а под ограничения hearing aids: два разнесенных устройства, мало энергии, ограниченный обмен между ушами и жесткая задержка. Авторы берут distributed binaural Tango-подход и перерабатывают его через ERB-компрессию, grouped recurrent mask estimation, temporal sparsification и asymmetric STFT, чтобы получить streaming-систему с latency 8 ms.

Метод. Базовая Tango-схема двухступенчатая: каждый ear-node локально оценивает speech/noise masks, считает SDW-MWF и передает сжатое представление на противоположный узел, после чего multi-node DNN уточняет masks. RT-Tango уменьшает размер входа через ERB filterbank, заменяет полнополосные RNN на grouped RNN и пропускает часть frame updates через fixed-rate skipping. Для online режима RT-Tango-OS использует asymmetric STFT: длинное analysis window сохраняет спектральное разрешение, а короткое synthesis window снижает algorithmic delay.

Результаты. По compute авторы показывают сильное сжатие без перехода к single-channel постановке. Tango-RNN требует 67.2 MMAC/s, RT-Tango — 33.4 MMAC/s, а GTCRN в их distributed setting — 197.5 MMAC/s. Streaming-вариант RT-Tango-OS работает с algorithmic latency 8 ms и стоит 35.14 MMAC/s при 250 frames/s; без temporal sparsification та же конфигурация стоила бы 124 MMAC/s. По качеству RT-Tango-OS ожидаемо уступает offline RT-Tango в SI-SDR/SI-SAR из-за online SCM estimation, но сохраняет конкурентные STOI/PESQ относительно high-rate baseline.

Ограничения. Оценка построена на симулированном training set и BinauRec subset с measured RIR, но это все еще контролируемая hearing-aid конфигурация с двумя микрофонами на ухо. FFT/iFFT cost исключен из MACs, поэтому embedded budget в реальном устройстве потребует дополнительного профилирования. Субъективных listening tests нет, а binaural perceptual comfort оценивается только косвенно через objective metrics и баланс между ушами.

Фишка из статьи. Самая практичная часть — разложение latency/compute trade-off: авторы не просто уменьшают модель, а показывают, какие блоки дают экономию и где качество начинает проседать.

КонфигурацияЗадержка / режимComputeЧто означает
Tango-RNNcausal RNN baseline67.2 MMAC/sупрощает исходный Tango, но еще дорогой
GTCRN distributedhigh-rate baseline197.5 MMAC/sпочти в 6 раз дороже RT-Tango
RT-Tangooffline SCM33.4 MMAC/sосновной выигрыш от ERB + GRNN + sparsification
RT-Tango-OSstrictly causal, 8 ms35.14 MMAC/sonline вариант для streaming hearing aids
RT-Tango-OS без sparsificationstrictly causal124 MMAC/sпоказывает цену frame-by-frame inference

Как это читать: real-time здесь достигается не одной “маленькой нейросетью”, а совместной оптимизацией DSP и neural inference. Особенно важен fixed-rate skipping: он предсказуемее learned skipping и снижает DNN cost с 67.5 до 28.08 MMAC/s при контролируемой потере качества.

Оригинальная статья на arXiv