MVDR без ручного WNG: сеть учит covariance mask и robustness threshold вместе
Это практичная работа про multichannel speech enhancement: MVDR beamforming хорош, пока массив и шум ведут себя ожидаемо, но начинает страдать от self-noise, mismatch микрофонов и плохо выбранных robustness-параметров. Авторы предлагают не подбирать white noise gain руками, а учить его вместе с covariance estimation.
Что сделали. Нейросеть одновременно предсказывает time-frequency noise mask для оценки covariance matrix и frequency-dependent WNG threshold. Затем differentiable robust MVDR layer позволяет оптимизировать всю систему end-to-end под качество enhancement, а не под отдельно выбранную эвристику diagonal loading.
Результат. На seen array conditions предложенный MVDR дает SNR gain 11.940 dB и Delta SDR 11.474 dB, заметно выше conventional вариантов с оптимально подобранными epsilon или W0. На unseen spacing 1 см и 3 см преимущество также сохраняется, что особенно важно для реальных микрофонных геометрий.
Почему это интересно для продукта. В прикладной речи beamforming часто ломается не из-за отсутствия MVDR, а из-за несовпадения условий: другое устройство, другая посадка микрофонов, другой уровень self-noise. Learned WNG делает robustness частью обучаемой модели и поэтому выглядит как хороший кандидат для более переносимого frontend enhancement.
Фишка из статьи. В MVDR-обзоре стоит сильнее подчеркнуть, что сеть учит не “магический mask”, а саму ручку robustness-directivity: frequency-dependent WNG threshold. Это превращает diagonal loading/WNG из глобальной ручной настройки в предсказываемый по частотам параметр, совместно обученный с covariance estimation.
| Array condition | Proposed Delta SDR | Best fixed/loaded baseline | Выигрыш |
|---|---|---|---|
| Seen, delta = 2.0 +/- eps cm | 11.474 dB | 9.510 dB | +1.964 dB |
| Unseen, delta = 1.0 +/- eps cm | 9.930 dB | 8.701 dB | +1.229 dB |
| Unseen, delta = 3.0 +/- eps cm | 10.850 dB | 8.786 dB | +2.064 dB |
Как это читать: преимущество сохраняется не только на seen array, но и на двух unseen spacing. Для реального speech frontend это важнее красивого результата на одном массиве: learned WNG снижает зависимость от заранее угаданной геометрии и уровня self-noise.