BiEAR: адаптивный auditory filterbank для локализации нескольких спикеров
BiEAR — работа на стыке auditory-inspired DSP и neural front-ends. Авторы берут идею medial olivocochlear feedback из человеческого слуха и делают binaural model, который во время inference адаптивно меняет frequency selectivity auditory filterbank-а. В результате left/right representations получают time-frequency varying resolution, а не фиксированную сетку признаков.
Зачем нужен adaptive filterbank
Много моделей локализации используют fixed computation graph: auditory-scaled spectrograms, IPD/ILD, GCC-like features или neural binaural representations. Но в реальных сценах условия меняются: число спикеров, расстояния, комната, реверберация и перекрытие речи. BiEAR добавляет neural feedback controller, который регулирует Q-factors auditory filterbank-а и тем самым выбирает более подходящую частотную селективность под сцену.
Эксперименты
Данные строятся по протоколу DeepEar: TIMIT utterances, BRIR spatialization, one/two/three-speaker mixtures. Anechoic training содержит 72 000 samples, validation/test — по 9 000. Для practical evaluation используются meeting room и lecture hall BRIR conditions с unseen speakers и другими акустическими условиями.
Результаты в anechoic
Лучший вариант BiEAR + Dual Controller + Relative control имеет 1.63M parameters. На one-speaker setup он дает sound detect accuracy 99.90/99.80 и azimuth MAE 0.36/0.39 degrees для seen/unseen speakers. Для two-speaker setup: 96.85/96.77 accuracy и 3.05/3.13 degrees MAE. Для three-speaker setup: 90.82/90.72 accuracy и 8.03/8.18 degrees MAE. Это лучше DeepEar и fixed/no-controller variants по ключевой метрике azimuth MAE.
Реальные комнаты
В practical environments голый перенос в комнаты сложнее, но после env. transfer BiEAR выглядит очень сильно. В meeting room для three-speaker case он получает sound detect accuracy 95.51%, azimuth MAE 6.59 degrees и distance accuracy 95.26%. В lecture hall для one-speaker case — 93.22%, 3.35 degrees и 90.89% distance accuracy. По таблице это лучшие значения среди DeepEar, AuralNet и BiEAR variants после environment transfer.
Практический вывод
BiEAR полезен как пример “серого ящика”: это не просто black-box audio encoder, а адаптивный auditory filterbank с интерпретируемой динамикой selectivity. Для multi-speaker localization, diarization front-end, robot audition и far-field speech capture такой подход интересен тем, что возвращает DSP-представление в обучаемую архитектуру, сохраняя возможность смотреть, какие частотные области модель усиливает во времени.
Фишка из статьи. BiEAR добавляет к binaural model не просто attention, а ear-specific controller, который модулирует Q-факторы фильтробанка. Лучший вариант - dual controller с relative Q modulation: он масштабирует базовый Q0[k] мультипликативно, что устойчивее additive absolute modulation.
| Модель | Params | 2-speaker detect | 2-speaker azim MAE | 2-speaker distance | 3-speaker azim MAE |
|---|---|---|---|---|---|
| DeepEar | 2.08M | 95.19 / 95.19 | 5.09 / 5.73 | 85.42 / 83.39 | 10.27 / 10.40 |
| AuralNet | 1.37M | - | 3.82 / 3.83 | - | 9.23 / 9.45 |
| BiEAR без controller | 1.29M | - | 4.67 / 4.64 | - | 10.47 / 10.62 |
| BiEAR Dual Controller Rel | 1.63M | 96.85 / 96.77 | 3.05 / 3.13 | 86.61 / 86.66 | 8.03 / 8.18 |
Ограничения controller тоже физически осмысленные: Q держится в диапазоне [0.05, 30], применяется smoothing β=0.8, а relative Q-variation достигает 1.6-29.2. В визуализациях, когда источник ближе к правому уху, правый фильтробанк получает более высокую селективность в средних/высоких полосах, тогда как низкие полосы остаются шире и поддерживают фазовые признаки.