Beamforming Speech enhancement Ambisonics
Beamforming

Weakly guided beamforming для moving speaker extraction в higher-order ambisonics

WER 15.5%

Статья предлагает weakly guided moving speaker extraction для higher-order ambisonics: известна только начальная direction of arrival target speaker, а дальше говорящий может двигаться среди других говорящих. Это попадает в практический разрыв между классическим beamforming, которому нужны надежные spatial statistics/DoA, и deep spatial filtering, который хуже переносится между массивами. Главная идея - оставить линейный MVDR beamformer, но параметризовать masks нейросетью, отделив temporal-spectral processing от spatial processing в ambisonics-domain.

Метод. Система работает с HOA representation и оценивает covariance matrices для MVDR через DNN mask estimator. В качестве weak guidance используются два сигнала: fixed beamformer, направленный в начальную DoA, и autoregressive feedback от уже обработанного beamformer output. Fixed beamformer дает temporally aligned cue в начале, но деградирует при движении; AR feedback лучше переносит длинные записи и быстрый motion, потому что обновляется по extracted speech.

Результаты. На synthetic two-speaker mixtures unprocessed audio имеет PESQ 1.13, ESTOI 43.4% и WER 112.3%. Oracle IRM дает PESQ 1.93, ESTOI 77.8% и WER 10.7%. С CRUSE mask estimator комбинация FB+AR достигает PESQ 1.65, ESTOI 69.2% и WER 22.5%; со SpatialNet - PESQ 1.77, ESTOI 73.3% и WER 15.5%. На real recordings с Eigenmike64 методы остаются устойчивыми для ambisonics order выше N=1, а переход с order 3 к 4 дает мало пользы при заметно большей вычислительной цене.

Ограничения. Метод все еще требует начального DoA target speaker; если стартовая подсказка неверна или target в начале плохо выделен, fixed-beamformer cue может быть слабым. Основные числа получены на simulated two-speaker mixtures, а real-recording часть имеет ограниченный размер и больше qualitative/project-page validation. Кроме того, статья работает с higher-order ambisonics и spherical-array setting, что не напрямую переносится на произвольные consumer microphone arrays.

Фишка из статьи. Таблица хорошо показывает инженерный компромисс между fixed guidance и autoregressive feedback. Для CRUSE один только FB почти не помогает, AR резко снижает WER, а их комбинация дает лучший результат; для SpatialNet комбинация также выигрывает, но преимущество меньше, потому что сам estimator сильнее.

Mask estimatorFBARMACsPESQESTOIWER
Unprocessed---1.1343.4%112.3%
IRM oracle---1.9377.8%10.7%
CRUSEданет2.3 G/s1.3859.2%45.4%
CRUSEнетда2.3 G/s1.6068.3%24.0%
CRUSEдада2.3 G/s1.6569.2%22.5%
SpatialNetдада18.7 G/s1.7773.3%15.5%

Как это читать: AR feedback важен именно как tracking-like signal для движения. Fixed beamformer хорошо задает начальную spatial prior, но без feedback WER у CRUSE остается 45.4%; добавление AR снижает его примерно вдвое.

Оригинальная статья на arXiv