Listen first: output-based beamforming для улучшения речи
Работа предлагает сменить точку принятия решения в многомикрофонном улучшении речи: не оценивать speech/noise statistics на грязном входе, а выбирать настройки beamformer по качеству его выхода. Для слуховых аппаратов это важный сценарий, потому что входной VAD именно в низком SNR работает хуже всего. Авторы показывают, что output-based выбор MPDR beamformer может обойти обычный input-based MVDR даже при coarse или non-individualized RTF dictionary.
Метод. Система строит набор кандидатных MPDR beamformers по словарю направлений и RTF-векторов. Для каждого кандидата считается выход, затем neural VAD оценивает T-F audibility, а выбор делается по Glimpse Proportion - доле time-frequency tiles, где речь достаточно слышна. Baseline - input-based MVDR, который использует тот же VAD, но для построения speech/noise masks на входных микрофонных сигналах. Сцены симулируются для bilateral hearing aids с двумя микрофонами на каждое ухо: LibriSpeech speech, один-три ESC-50 noise sources, isotropic speech-shaped noise и HRIR из OTIMP.
Результаты. При input SNR -5 dB output-based MPDR стабильно лучше input-based MVDR по ΔSNR, ΔESTOI и ΔPESQ. Например, при segment duration 0.6 s MVDR дает ΔSNR 6.69 dB, ΔESTOI -0.02 и ΔPESQ 0.02; matched MPDRF дает 10.64 dB, 0.26 и 0.10. Даже при mismatch система сохраняет преимущество: MPDRU с coarse 15° dictionary дает 7.88 dB и 0.15 ESTOI, MPDRS с non-individualized HATS RTF - 7.87 dB и 0.14 ESTOI. По статье различия по SNR и ESTOI статистически значимы для mismatch-условий.
Ограничения. Это симуляция, а не запись реальных пользователей слуховых аппаратов; HRIR взяты из OTIMP с удаленными late reverberations, сцены короткие по 5 секунд. Beamformer selection в экспериментах non-causal: система видит весь segment перед выбором весов, хотя авторы отмечают, что causal вариант можно строить по предыдущим segment estimates. VAD обучен всего на 1 час синтетических сцен, а субъективной оценки слухового качества и реальной разборчивости у пользователей нет.
Фишка из статьи. Таблица RTF mismatch полезна практически: она показывает, что output-based selection не требует идеального персонального HRTF, чтобы быть лучше input-based MVDR в низком SNR.
| DT | MVDR ΔSNR | MPDRU ΔSNR | MPDRS ΔSNR | MPDRF ΔSNR | MPDRF ΔESTOI |
|---|---|---|---|---|---|
| 0.2 s | 6.33 | 7.40 | 7.65 | 9.21 | 0.14 |
| 0.4 s | 6.42 | 7.69 | 7.73 | 10.19 | 0.23 |
| 0.6 s | 6.69 | 7.88 | 7.87 | 10.64 | 0.26 |
| 1.0 s | 6.78 | 7.97 | 7.90 | 11.00 | 0.28 |
Как это читать: MPDRF - matched dictionary, MPDRU - более грубый angular grid, MPDRS - non-individualized mannequin RTF. Даже mismatch-варианты держат ΔSNR выше MVDR, потому что выбор делается по выходу кандидата, а не по ненадежной оценке speech/noise tiles на входе.