LAIP: локализация звука из audio-visual retrieval backbone
LAIP показывает, что крупная audio-visual retrieval model может стать локализатором звучащего объекта без плотной supervision-разметки. Retrieval backbone обычно сжимает кадр в глобальный token и теряет пространственную детализацию; авторы вставляют audio-informed spatial pooling между frame encoder и video encoder. Главный ход - заставить аудио query intermediate visual tokens до того, как модель окончательно свернет пространственную сетку.
Метод. LAIP строится поверх PE-AV: audio tokens выравниваются с частотой кадров через легкий temporal aggregator, затем три AiSP-модуля постепенно уменьшают spatial grid. Attention maps этих модулей используются как localization maps, а обучение остается weakly supervised через audio-video contrastive objective. Дополнительно вводятся null-token regularization и multi-resolution consistency, чтобы карты не разваливались по scale.
Результаты. На AVATAR LAIP с 10k training videos сильно превосходит локализационные baseline: в single-sound scenario CIoU/AUC 27.63/27.77 против 13.42/14.08 у TAVLO; в mixed-sound 27.35/27.40 против 14.13/14.52; в multi-entity 23.69/23.85 против 12.08/12.69. На AVSBench S4 метод получает mask-IoU 39.31 и F-score 65.18, на MS3 - 30.77 и 49.00. На ADE-SP он достигает m-IoU 33.35 и mAP 53.57.
Ограничения. LAIP не улучшает масштабируемый retrieval напрямую: поскольку visual features становятся conditioned on input audio, видео нельзя заранее один раз проиндексировать для всех audio queries. Также модель дает attention maps, а не полноценные segmentation logits, поэтому mask-IoU с фиксированным threshold может недооценивать правильную локализацию. Failure cases остаются для очень маленьких или очень больших источников.
Фишка из статьи. Абляция хорошо показывает, что успех не приходит от generic attribution. Нужна именно постепенная audio-informed pooling схема с регуляризацией.
| Вариант | CIoU | AUC | Что изменено |
|---|---|---|---|
| LAIP | 26.22% | 26.34% | Полная схема |
| Без null-token regularization | 23.01% | 23.27% | Нет μ |
| Без μ и consistency | 19.45% | 19.53% | Нет μ и λ |
| Gradient-based maps | 4.14% | 4.89% | Простая attribution-карта |
| Attention pooling | 14.34% | 14.74% | Один pooling-слой вместо иерархии |
Как это читать: пространственная информация в retrieval backbone есть, но ее нельзя просто достать градиентом. Audio query должен поэтапно сжимать visual tokens, иначе карта либо слишком диффузная, либо теряет мелкие cues слишком рано.