MVDR WNG Array
Beamforming

MVDR без ручного WNG: сеть учит covariance mask и robustness threshold вместе

Delta SDR 11.47 dB

Это практичная работа про multichannel speech enhancement: MVDR beamforming хорош, пока массив и шум ведут себя ожидаемо, но начинает страдать от self-noise, mismatch микрофонов и плохо выбранных robustness-параметров. Авторы предлагают не подбирать white noise gain руками, а учить его вместе с covariance estimation.

Что сделали. Нейросеть одновременно предсказывает time-frequency noise mask для оценки covariance matrix и frequency-dependent WNG threshold. Затем differentiable robust MVDR layer позволяет оптимизировать всю систему end-to-end под качество enhancement, а не под отдельно выбранную эвристику diagonal loading.

Результат. На seen array conditions предложенный MVDR дает SNR gain 11.940 dB и Delta SDR 11.474 dB, заметно выше conventional вариантов с оптимально подобранными epsilon или W0. На unseen spacing 1 см и 3 см преимущество также сохраняется, что особенно важно для реальных микрофонных геометрий.

Почему это интересно для продукта. В прикладной речи beamforming часто ломается не из-за отсутствия MVDR, а из-за несовпадения условий: другое устройство, другая посадка микрофонов, другой уровень self-noise. Learned WNG делает robustness частью обучаемой модели и поэтому выглядит как хороший кандидат для более переносимого frontend enhancement.

Фишка из статьи. В MVDR-обзоре стоит сильнее подчеркнуть, что сеть учит не “магический mask”, а саму ручку robustness-directivity: frequency-dependent WNG threshold. Это превращает diagonal loading/WNG из глобальной ручной настройки в предсказываемый по частотам параметр, совместно обученный с covariance estimation.

Array conditionProposed Delta SDRBest fixed/loaded baselineВыигрыш
Seen, delta = 2.0 +/- eps cm11.474 dB9.510 dB+1.964 dB
Unseen, delta = 1.0 +/- eps cm9.930 dB8.701 dB+1.229 dB
Unseen, delta = 3.0 +/- eps cm10.850 dB8.786 dB+2.064 dB

Как это читать: преимущество сохраняется не только на seen array, но и на двух unseen spacing. Для реального speech frontend это важнее красивого результата на одном массиве: learned WNG снижает зависимость от заранее угаданной геометрии и уровня self-noise.

Оригинальная статья на arXiv