LAM и microphone gap: повышение числа каналов массива важнее согласовать с картой
Статья разбирает практический разрыв между красивыми результатами Latent Acoustic Mapping на 32-канальном микрофонном массиве и реальными устройствами, где каналов часто четыре. Авторы проверяют, можно ли сначала восстановить 32-канальную кросс-спектральную матрицу из 4 каналов, а затем подать ее в LAM для локализации источников. Главный вывод трезвый: само повышение числа каналов может поднять recall, но без согласования с LAM оно часто ухудшает угловую ошибку.
Метод. Сравниваются несколько моделей повышения разрешения массива: интерполяция, SRCNN, DBPN, SAFMN, AINN и GAN. Их обучают тремя способами: отдельно на восстановление CSM, с выравниванием под LAM или end-to-end через LAM loss. Оценка идет на LOCATA, STARSS23 и AudibleLight по ошибке локализации и recall, а дополнительно авторы смотрят CMD между истинной CSM и промежуточными матрицами внутри LAM.
Результаты. Полный 32-канальный LAM остается ориентиром: 14.5 градуса на LOCATA и 25.3 градуса на AudibleLight. Отдельно обученные модели часто дают высокий recall, но не лучшую локализацию: на LOCATA только SRCNN с distinct training близко подходит к полному LAM - 15.6 градуса против 14.5. На AudibleLight лучшие угловые ошибки дают end-to-end DBPN и SAFMN: 45.3 и 44.5 градуса, но это все еще далеко от полного 32-канального ориентира.
Ограничения. Это бенчмарк пространственного аудио, а не готовое решение для речи в комнате: наборы данных ограничены, статистическая неопределенность ошибок не приведена, а насыщение recall на STARSS23 авторы сами считают плохо объясненным. Кроме того, оптимизация под LAM может создавать признаки, полезные конкретной модели, но не физически точную CSM.
Фишка из статьи. Самая интересная часть - диагностический анализ CMD. Он показывает, что upsampler иногда восстанавливает CSM лучше, чем итоговый выход LAM, то есть узкое место может быть не в повышении числа каналов, а в последующем отображении latent acoustic image обратно в CSM.
| Вариант | LOCATA error | AudibleLight error | Комментарий |
|---|---|---|---|
| Full-resolution LAM | 14.5° | 25.3° | 32-канальный ориентир |
| SRCNN + LAM, distinct | 15.6° | выше лучших aligned/e2e | Близко к LAM на LOCATA |
| DBPN + LAM, end-to-end | 19.4° | 45.3° | Один из лучших на AudibleLight |
| SAFMN + LAM, end-to-end | 23.2° | 44.5° | Лучшая ошибка на AudibleLight |
Как это читать: более сложная сеть и больше FLOPs не гарантируют лучшую локализацию. Важнее, совпадает ли восстановленная пространственная статистика с тем, что LAM умеет обрабатывать без сдвига распределения.