Акустика помещений DOA Микрофонные решетки
arXiv eess.AS

Array-generic DOA: оценка направления источника через передаточные функции решетки

arXiv:2608.09425

Эта работа попадает в room acoustics часть поиска: она про оценку направления прихода звука на микрофонных решетках, но с переносом на неизвестные устройства. Проблема в том, что многие нейросетевые DOA-модели привязаны к геометрии решетки из обучения. Авторы предлагают подавать модели не только спектрограмму, но и complex array transfer functions, чтобы она могла адаптироваться к новой решетке без переобучения под конкретный корпус.

Метод. Метод использует отдельные сверточные кодировщики для многоканальной спектрограммы и ATF-метаданных, затем объединяет представления через cross-attention. Выход - multi-source Cartesian vector formulation, то есть модель одновременно оценивает наличие и направление источников. Данные моделируются в комнатах 4-6 x 8-10 x 2.5-3.5 м, RT60 от 0.23 до 0.8 с, расстояние источника 1-3 м, с диффузным babble noise и mobile-phone-like решетками.

Результаты. В 2D single-source задаче Proposed дает F1@5° 0.75 и localization error 4.0°, уступая MUSIC по обоим числам, но имея меньший LE, чем FCGA: 4.0° против 9.8°. В 3D reverberant+noise для omni arrays Proposed получает F1 0.99/0.69/0.58/0.50 и LE 22.9/28.7/31.2/30.7° для 1/2/3/4 источников; MUSIC с oracle числом источников силен при одном источнике, но LE растет до 51.1-53.4° на 3-4 источниках. На mobile arrays Proposed дает F1 0.99/0.72/0.61/0.54.

Ограничения. Оценка в основном симуляционная; measured real-world data остается будущей работой. MUSIC получает oracle source count, поэтому сравнение не полностью симметрично. В 3D F1 считается с широким 180° threshold, чтобы сфокусироваться на числе источников, поэтому localization error нужно читать отдельно. Авторы сами отмечают необходимость улучшить single-source accuracy и проверить разные числа микрофонов.

Фишка из статьи. Интересная инженерная часть - модель проигрывает классическому MUSIC в простом single-source режиме, но деградирует плавнее при росте числа источников.

СравнениеЧислоЧто означает
2D ProposedF1@5° 0.75, LE 4.0°Средняя нейросетевая точность на single-source
2D MUSICF1@5° 0.97, LE 1.5°Классический метод силен в простой постановке
3D rev+noise, 1 sourceF1 0.99, LE 22.9°Модель хорошо детектирует источник, но угол грубее MUSIC
3D rev+noise, 4 sourcesF1 0.50, LE 30.7°Падение есть, но LE ниже MUSIC 53.4°
Mobile rev+noise, 4 sourcesF1 0.54, LE 34.1°ATF-conditioning переносится на телефоноподобную решетку

Как это читать: это не замена MUSIC во всех режимах, а шаг к нейросетевой DOA-модели, которая знает акустику конкретной решетки через ATF и поэтому может работать вне фиксированной геометрии обучения.

Оригинальная статья на arXiv