RT-Tango: binaural speech enhancement для hearing aids с 8 ms latency
RT-Tango интересна как системная работа по speech enhancement не “в вакууме”, а под ограничения hearing aids: два разнесенных устройства, мало энергии, ограниченный обмен между ушами и жесткая задержка. Авторы берут distributed binaural Tango-подход и перерабатывают его через ERB-компрессию, grouped recurrent mask estimation, temporal sparsification и asymmetric STFT, чтобы получить streaming-систему с latency 8 ms.
Метод. Базовая Tango-схема двухступенчатая: каждый ear-node локально оценивает speech/noise masks, считает SDW-MWF и передает сжатое представление на противоположный узел, после чего multi-node DNN уточняет masks. RT-Tango уменьшает размер входа через ERB filterbank, заменяет полнополосные RNN на grouped RNN и пропускает часть frame updates через fixed-rate skipping. Для online режима RT-Tango-OS использует asymmetric STFT: длинное analysis window сохраняет спектральное разрешение, а короткое synthesis window снижает algorithmic delay.
Результаты. По compute авторы показывают сильное сжатие без перехода к single-channel постановке. Tango-RNN требует 67.2 MMAC/s, RT-Tango — 33.4 MMAC/s, а GTCRN в их distributed setting — 197.5 MMAC/s. Streaming-вариант RT-Tango-OS работает с algorithmic latency 8 ms и стоит 35.14 MMAC/s при 250 frames/s; без temporal sparsification та же конфигурация стоила бы 124 MMAC/s. По качеству RT-Tango-OS ожидаемо уступает offline RT-Tango в SI-SDR/SI-SAR из-за online SCM estimation, но сохраняет конкурентные STOI/PESQ относительно high-rate baseline.
Ограничения. Оценка построена на симулированном training set и BinauRec subset с measured RIR, но это все еще контролируемая hearing-aid конфигурация с двумя микрофонами на ухо. FFT/iFFT cost исключен из MACs, поэтому embedded budget в реальном устройстве потребует дополнительного профилирования. Субъективных listening tests нет, а binaural perceptual comfort оценивается только косвенно через objective metrics и баланс между ушами.
Фишка из статьи. Самая практичная часть — разложение latency/compute trade-off: авторы не просто уменьшают модель, а показывают, какие блоки дают экономию и где качество начинает проседать.
| Конфигурация | Задержка / режим | Compute | Что означает |
|---|---|---|---|
| Tango-RNN | causal RNN baseline | 67.2 MMAC/s | упрощает исходный Tango, но еще дорогой |
| GTCRN distributed | high-rate baseline | 197.5 MMAC/s | почти в 6 раз дороже RT-Tango |
| RT-Tango | offline SCM | 33.4 MMAC/s | основной выигрыш от ERB + GRNN + sparsification |
| RT-Tango-OS | strictly causal, 8 ms | 35.14 MMAC/s | online вариант для streaming hearing aids |
| RT-Tango-OS без sparsification | strictly causal | 124 MMAC/s | показывает цену frame-by-frame inference |
Как это читать: real-time здесь достигается не одной “маленькой нейросетью”, а совместной оптимизацией DSP и neural inference. Особенно важен fixed-rate skipping: он предсказуемее learned skipping и снижает DNN cost с 67.5 до 28.08 MMAC/s при контролируемой потере качества.