Filterbank Binaural Localization
Auditory DSP front-end

BiEAR: адаптивный auditory filterbank для локализации нескольких спикеров

Azim. MAE 3.05°

BiEAR — работа на стыке auditory-inspired DSP и neural front-ends. Авторы берут идею medial olivocochlear feedback из человеческого слуха и делают binaural model, который во время inference адаптивно меняет frequency selectivity auditory filterbank-а. В результате left/right representations получают time-frequency varying resolution, а не фиксированную сетку признаков.

Зачем нужен adaptive filterbank

Много моделей локализации используют fixed computation graph: auditory-scaled spectrograms, IPD/ILD, GCC-like features или neural binaural representations. Но в реальных сценах условия меняются: число спикеров, расстояния, комната, реверберация и перекрытие речи. BiEAR добавляет neural feedback controller, который регулирует Q-factors auditory filterbank-а и тем самым выбирает более подходящую частотную селективность под сцену.

Эксперименты

Данные строятся по протоколу DeepEar: TIMIT utterances, BRIR spatialization, one/two/three-speaker mixtures. Anechoic training содержит 72 000 samples, validation/test — по 9 000. Для practical evaluation используются meeting room и lecture hall BRIR conditions с unseen speakers и другими акустическими условиями.

Результаты в anechoic

Лучший вариант BiEAR + Dual Controller + Relative control имеет 1.63M parameters. На one-speaker setup он дает sound detect accuracy 99.90/99.80 и azimuth MAE 0.36/0.39 degrees для seen/unseen speakers. Для two-speaker setup: 96.85/96.77 accuracy и 3.05/3.13 degrees MAE. Для three-speaker setup: 90.82/90.72 accuracy и 8.03/8.18 degrees MAE. Это лучше DeepEar и fixed/no-controller variants по ключевой метрике azimuth MAE.

Реальные комнаты

В practical environments голый перенос в комнаты сложнее, но после env. transfer BiEAR выглядит очень сильно. В meeting room для three-speaker case он получает sound detect accuracy 95.51%, azimuth MAE 6.59 degrees и distance accuracy 95.26%. В lecture hall для one-speaker case — 93.22%, 3.35 degrees и 90.89% distance accuracy. По таблице это лучшие значения среди DeepEar, AuralNet и BiEAR variants после environment transfer.

Практический вывод

BiEAR полезен как пример “серого ящика”: это не просто black-box audio encoder, а адаптивный auditory filterbank с интерпретируемой динамикой selectivity. Для multi-speaker localization, diarization front-end, robot audition и far-field speech capture такой подход интересен тем, что возвращает DSP-представление в обучаемую архитектуру, сохраняя возможность смотреть, какие частотные области модель усиливает во времени.

Фишка из статьи. BiEAR добавляет к binaural model не просто attention, а ear-specific controller, который модулирует Q-факторы фильтробанка. Лучший вариант - dual controller с relative Q modulation: он масштабирует базовый Q0[k] мультипликативно, что устойчивее additive absolute modulation.

МодельParams2-speaker detect2-speaker azim MAE2-speaker distance3-speaker azim MAE
DeepEar2.08M95.19 / 95.195.09 / 5.7385.42 / 83.3910.27 / 10.40
AuralNet1.37M-3.82 / 3.83-9.23 / 9.45
BiEAR без controller1.29M-4.67 / 4.64-10.47 / 10.62
BiEAR Dual Controller Rel1.63M96.85 / 96.773.05 / 3.1386.61 / 86.668.03 / 8.18

Ограничения controller тоже физически осмысленные: Q держится в диапазоне [0.05, 30], применяется smoothing β=0.8, а relative Q-variation достигает 1.6-29.2. В визуализациях, когда источник ближе к правому уху, правый фильтробанк получает более высокую селективность в средних/высоких полосах, тогда как низкие полосы остаются шире и поддерживают фазовые признаки.

Оригинальная статья на arXiv