SelectTSL: prompt-guided localization только нужного sound source
SelectTSL закрывает важный пробел между sound source localization и target sound extraction: обычный SSL локализует все активные источники, а TSE выбирает нужный звук, но часто теряет spatial cues. Авторы формулируют prompt-guided selective target sound localization: по текстовому или 1-секундному audio prompt нужно найти только заданный класс источника в шумной multi-source сцене.
Метод. Архитектура использует Prompt-Guided Selective Attention, чтобы получить extraction-informed embeddings для целевого звука. Эти embeddings управляют IPD enhancer: он уточняет inter-channel phase difference, после чего target magnitudes и phase cues вместе идут в DoA estimator. Отдельная cardinality head предсказывает число активных target sources по кадрам, чтобы модель могла не только локализовать угол, но и вести переменное число источников.
Результаты. Simulated split содержит 288.9/31.1/18.1 часа train/val/test и 208008/22392/13032 clips; real split на TAU-SRIR содержит 72000/9000/9000 clips, 397 target categories, 5-секундные dual-channel 16 kHz mixtures и SNR от -5 до 5 dB. В main table SelectTSL на mixture получает MAE 0.98°, precision 98.28%, F1 95.67%, recall 93.20%, MOTA* 91.57%, DetA 91.70% и OSPA-T 2.08°. Это сильно выше baseline-семейств, где даже clean/split варианты часто дают F1 около 40–85% и хуже tracking metrics.
Ограничения. Сцены синтезированы, а real evaluation использует TAU-SRIR через фиксированные SRIR и двухканальную конфигурацию; перенос на большие массивы, движущиеся источники с непрерывной геометрией и реальные шумы требует отдельной проверки. Text-only режим чувствителен к близости prompt к canonical caption, а audio-only режим чувствителен к тому, взят ли cue из того же клипа.
Фишка из статьи. Ablation показывает, что главный выигрыш не просто от prompt conditioning, а от совместного использования target embeddings и phase cues. Удаление IPD почти разрушает tracking.
| Вариант | MAE | F1 | MOTA* | OSPA-T |
|---|---|---|---|---|
| Full SelectTSL | 0.98° | 95.67% | 91.57% | 2.08° |
| w/o EIEs | 1.21° | 93.58% | 87.93% | 2.72° |
| Mix → DoA | 3.32° | 65.92% | 49.16% | 7.82° |
| w/o ILD | 1.79° | 87.18% | 77.27% | 4.14° |
| w/o IPD | 3.89° | 60.43% | 43.30% | 8.39° |
| w/o cardinality head | 2.91° | 73.57% | 58.19% | 6.33° |
Как это читать: prompt сам по себе недостаточен. Самый сильный провал дает удаление IPD: модель еще может “понимать”, какой звук нужен, но теряет spatial fingerprint, поэтому DoA и trajectory association деградируют одновременно.