SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval
SonicCaps проверяет гипотезу, что поиску аудио не столько не хватает записей, сколько разных способов описать одну и ту же запись. Для примерно 700 тысяч звуков авторы создают около 15 млн длинных, кратких и перефразированных подписей, а затем обучают контрастивную модель на том же звуковом материале, меняя именно плотность языковых описаний.
Метод. Qwen3-Omni получает звук и исходную подпись, формирует основное подробное описание, десять перефразировок, десять кратких вариантов и набор меток. В среднем приходится 23,9 подписи на запись. Сравниваются режимы с одной качественной подписью и со смесью описаний; отдельно измеряется поиск текста по звуку, когда достаточно найти любую верную подпись и когда требуется вернуть все девять вариантов.
Результаты. На AudioCaps поиск звука по тексту достигает R@5 79,5% и R@10 91,3% против 64,7% и 75,8% у LAION-CLAP. Для обратного поиска критерий «любая из девяти подписей» даёт R@5 71,3%, но строгий критерий «все девять» — только 9,5%. На непересекающемся Foley наборе R@1 растёт с 1,34% до 8,34%, что подтверждает перенос за пределы знакомых классов. В слепой оценке примерно половина подписей SonicCaps не получила ни одного отрицательного флага против менее четверти у сопоставленных источников.
Ограничения. Подписи синтетические и наследуют ошибки мультимодальной модели, а ограничения генерации лишь мягкие. Пересечение исходных аудиозаписей с ESC-50 может завышать часть результатов; доступны идентификаторы и подписи, но не единый свободно распространяемый звуковой архив. Внутренний коммерческий набор не воспроизводим извне.
Фишка из статьи. Девять правильных формулировок для одного звука превращают обычный поиск в проверку покрытия смыслового множества.
| Модель | Текст → звук R@5 | Текст → звук R@10 | Звук → любая подпись R@5 | Звук → все 9 подписей R@5 |
|---|---|---|---|---|
| LAION-CLAP | 64,7 | 75,8 | 28,7 | — |
| SonicCaps, смешанный режим | 79,5 | 91,3 | 71,3 | 9,5 |
Как это читать: обычный R@5 заметно растёт, но строгий столбец показывает, что модель ещё не считает разные описания полностью взаимозаменяемыми. Набор полезен именно для изучения этой неполной смысловой устойчивости, а не только как способ поднять одну метрику поиска.