Weakly guided beamforming для moving speaker extraction в higher-order ambisonics
Статья предлагает weakly guided moving speaker extraction для higher-order ambisonics: известна только начальная direction of arrival target speaker, а дальше говорящий может двигаться среди других говорящих. Это попадает в практический разрыв между классическим beamforming, которому нужны надежные spatial statistics/DoA, и deep spatial filtering, который хуже переносится между массивами. Главная идея - оставить линейный MVDR beamformer, но параметризовать masks нейросетью, отделив temporal-spectral processing от spatial processing в ambisonics-domain.
Метод. Система работает с HOA representation и оценивает covariance matrices для MVDR через DNN mask estimator. В качестве weak guidance используются два сигнала: fixed beamformer, направленный в начальную DoA, и autoregressive feedback от уже обработанного beamformer output. Fixed beamformer дает temporally aligned cue в начале, но деградирует при движении; AR feedback лучше переносит длинные записи и быстрый motion, потому что обновляется по extracted speech.
Результаты. На synthetic two-speaker mixtures unprocessed audio имеет PESQ 1.13, ESTOI 43.4% и WER 112.3%. Oracle IRM дает PESQ 1.93, ESTOI 77.8% и WER 10.7%. С CRUSE mask estimator комбинация FB+AR достигает PESQ 1.65, ESTOI 69.2% и WER 22.5%; со SpatialNet - PESQ 1.77, ESTOI 73.3% и WER 15.5%. На real recordings с Eigenmike64 методы остаются устойчивыми для ambisonics order выше N=1, а переход с order 3 к 4 дает мало пользы при заметно большей вычислительной цене.
Ограничения. Метод все еще требует начального DoA target speaker; если стартовая подсказка неверна или target в начале плохо выделен, fixed-beamformer cue может быть слабым. Основные числа получены на simulated two-speaker mixtures, а real-recording часть имеет ограниченный размер и больше qualitative/project-page validation. Кроме того, статья работает с higher-order ambisonics и spherical-array setting, что не напрямую переносится на произвольные consumer microphone arrays.
Фишка из статьи. Таблица хорошо показывает инженерный компромисс между fixed guidance и autoregressive feedback. Для CRUSE один только FB почти не помогает, AR резко снижает WER, а их комбинация дает лучший результат; для SpatialNet комбинация также выигрывает, но преимущество меньше, потому что сам estimator сильнее.
| Mask estimator | FB | AR | MACs | PESQ | ESTOI | WER |
|---|---|---|---|---|---|---|
| Unprocessed | - | - | - | 1.13 | 43.4% | 112.3% |
| IRM oracle | - | - | - | 1.93 | 77.8% | 10.7% |
| CRUSE | да | нет | 2.3 G/s | 1.38 | 59.2% | 45.4% |
| CRUSE | нет | да | 2.3 G/s | 1.60 | 68.3% | 24.0% |
| CRUSE | да | да | 2.3 G/s | 1.65 | 69.2% | 22.5% |
| SpatialNet | да | да | 18.7 G/s | 1.77 | 73.3% | 15.5% |
Как это читать: AR feedback важен именно как tracking-like signal для движения. Fixed beamformer хорошо задает начальную spatial prior, но без feedback WER у CRUSE остается 45.4%; добавление AR снижает его примерно вдвое.