Array-generic DOA: оценка направления источника через передаточные функции решетки
Эта работа попадает в room acoustics часть поиска: она про оценку направления прихода звука на микрофонных решетках, но с переносом на неизвестные устройства. Проблема в том, что многие нейросетевые DOA-модели привязаны к геометрии решетки из обучения. Авторы предлагают подавать модели не только спектрограмму, но и complex array transfer functions, чтобы она могла адаптироваться к новой решетке без переобучения под конкретный корпус.
Метод. Метод использует отдельные сверточные кодировщики для многоканальной спектрограммы и ATF-метаданных, затем объединяет представления через cross-attention. Выход - multi-source Cartesian vector formulation, то есть модель одновременно оценивает наличие и направление источников. Данные моделируются в комнатах 4-6 x 8-10 x 2.5-3.5 м, RT60 от 0.23 до 0.8 с, расстояние источника 1-3 м, с диффузным babble noise и mobile-phone-like решетками.
Результаты. В 2D single-source задаче Proposed дает F1@5° 0.75 и localization error 4.0°, уступая MUSIC по обоим числам, но имея меньший LE, чем FCGA: 4.0° против 9.8°. В 3D reverberant+noise для omni arrays Proposed получает F1 0.99/0.69/0.58/0.50 и LE 22.9/28.7/31.2/30.7° для 1/2/3/4 источников; MUSIC с oracle числом источников силен при одном источнике, но LE растет до 51.1-53.4° на 3-4 источниках. На mobile arrays Proposed дает F1 0.99/0.72/0.61/0.54.
Ограничения. Оценка в основном симуляционная; measured real-world data остается будущей работой. MUSIC получает oracle source count, поэтому сравнение не полностью симметрично. В 3D F1 считается с широким 180° threshold, чтобы сфокусироваться на числе источников, поэтому localization error нужно читать отдельно. Авторы сами отмечают необходимость улучшить single-source accuracy и проверить разные числа микрофонов.
Фишка из статьи. Интересная инженерная часть - модель проигрывает классическому MUSIC в простом single-source режиме, но деградирует плавнее при росте числа источников.
| Сравнение | Число | Что означает |
|---|---|---|
| 2D Proposed | F1@5° 0.75, LE 4.0° | Средняя нейросетевая точность на single-source |
| 2D MUSIC | F1@5° 0.97, LE 1.5° | Классический метод силен в простой постановке |
| 3D rev+noise, 1 source | F1 0.99, LE 22.9° | Модель хорошо детектирует источник, но угол грубее MUSIC |
| 3D rev+noise, 4 sources | F1 0.50, LE 30.7° | Падение есть, но LE ниже MUSIC 53.4° |
| Mobile rev+noise, 4 sources | F1 0.54, LE 34.1° | ATF-conditioning переносится на телефоноподобную решетку |
Как это читать: это не замена MUSIC во всех режимах, а шаг к нейросетевой DOA-модели, которая знает акустику конкретной решетки через ATF и поэтому может работать вне фиксированной геометрии обучения.