Локализация звука Audio-visual Retrieval
Пространственное аудио

LAIP: локализация звука из audio-visual retrieval backbone

F-score 65.18

LAIP показывает, что крупная audio-visual retrieval model может стать локализатором звучащего объекта без плотной supervision-разметки. Retrieval backbone обычно сжимает кадр в глобальный token и теряет пространственную детализацию; авторы вставляют audio-informed spatial pooling между frame encoder и video encoder. Главный ход - заставить аудио query intermediate visual tokens до того, как модель окончательно свернет пространственную сетку.

Метод. LAIP строится поверх PE-AV: audio tokens выравниваются с частотой кадров через легкий temporal aggregator, затем три AiSP-модуля постепенно уменьшают spatial grid. Attention maps этих модулей используются как localization maps, а обучение остается weakly supervised через audio-video contrastive objective. Дополнительно вводятся null-token regularization и multi-resolution consistency, чтобы карты не разваливались по scale.

Результаты. На AVATAR LAIP с 10k training videos сильно превосходит локализационные baseline: в single-sound scenario CIoU/AUC 27.63/27.77 против 13.42/14.08 у TAVLO; в mixed-sound 27.35/27.40 против 14.13/14.52; в multi-entity 23.69/23.85 против 12.08/12.69. На AVSBench S4 метод получает mask-IoU 39.31 и F-score 65.18, на MS3 - 30.77 и 49.00. На ADE-SP он достигает m-IoU 33.35 и mAP 53.57.

Ограничения. LAIP не улучшает масштабируемый retrieval напрямую: поскольку visual features становятся conditioned on input audio, видео нельзя заранее один раз проиндексировать для всех audio queries. Также модель дает attention maps, а не полноценные segmentation logits, поэтому mask-IoU с фиксированным threshold может недооценивать правильную локализацию. Failure cases остаются для очень маленьких или очень больших источников.

Фишка из статьи. Абляция хорошо показывает, что успех не приходит от generic attribution. Нужна именно постепенная audio-informed pooling схема с регуляризацией.

ВариантCIoUAUCЧто изменено
LAIP26.22%26.34%Полная схема
Без null-token regularization23.01%23.27%Нет μ
Без μ и consistency19.45%19.53%Нет μ и λ
Gradient-based maps4.14%4.89%Простая attribution-карта
Attention pooling14.34%14.74%Один pooling-слой вместо иерархии

Как это читать: пространственная информация в retrieval backbone есть, но ее нельзя просто достать градиентом. Audio query должен поэтапно сжимать visual tokens, иначе карта либо слишком диффузная, либо теряет мелкие cues слишком рано.

Оригинальная статья на arXiv