Localization IPD Prompt
Spatial audio

SelectTSL: prompt-guided localization только нужного sound source

MAE 0.98°

SelectTSL закрывает важный пробел между sound source localization и target sound extraction: обычный SSL локализует все активные источники, а TSE выбирает нужный звук, но часто теряет spatial cues. Авторы формулируют prompt-guided selective target sound localization: по текстовому или 1-секундному audio prompt нужно найти только заданный класс источника в шумной multi-source сцене.

Метод. Архитектура использует Prompt-Guided Selective Attention, чтобы получить extraction-informed embeddings для целевого звука. Эти embeddings управляют IPD enhancer: он уточняет inter-channel phase difference, после чего target magnitudes и phase cues вместе идут в DoA estimator. Отдельная cardinality head предсказывает число активных target sources по кадрам, чтобы модель могла не только локализовать угол, но и вести переменное число источников.

Результаты. Simulated split содержит 288.9/31.1/18.1 часа train/val/test и 208008/22392/13032 clips; real split на TAU-SRIR содержит 72000/9000/9000 clips, 397 target categories, 5-секундные dual-channel 16 kHz mixtures и SNR от -5 до 5 dB. В main table SelectTSL на mixture получает MAE 0.98°, precision 98.28%, F1 95.67%, recall 93.20%, MOTA* 91.57%, DetA 91.70% и OSPA-T 2.08°. Это сильно выше baseline-семейств, где даже clean/split варианты часто дают F1 около 40–85% и хуже tracking metrics.

Ограничения. Сцены синтезированы, а real evaluation использует TAU-SRIR через фиксированные SRIR и двухканальную конфигурацию; перенос на большие массивы, движущиеся источники с непрерывной геометрией и реальные шумы требует отдельной проверки. Text-only режим чувствителен к близости prompt к canonical caption, а audio-only режим чувствителен к тому, взят ли cue из того же клипа.

Фишка из статьи. Ablation показывает, что главный выигрыш не просто от prompt conditioning, а от совместного использования target embeddings и phase cues. Удаление IPD почти разрушает tracking.

ВариантMAEF1MOTA*OSPA-T
Full SelectTSL0.98°95.67%91.57%2.08°
w/o EIEs1.21°93.58%87.93%2.72°
Mix → DoA3.32°65.92%49.16%7.82°
w/o ILD1.79°87.18%77.27%4.14°
w/o IPD3.89°60.43%43.30%8.39°
w/o cardinality head2.91°73.57%58.19%6.33°

Как это читать: prompt сам по себе недостаточен. Самый сильный провал дает удаление IPD: модель еще может “понимать”, какой звук нужен, но теряет spatial fingerprint, поэтому DoA и trajectory association деградируют одновременно.

Оригинальная статья на arXiv