описание звука поиск аудио обучающие данные
arXiv cs.SD

SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

arXiv:2609.02343

SonicCaps проверяет гипотезу, что поиску аудио не столько не хватает записей, сколько разных способов описать одну и ту же запись. Для примерно 700 тысяч звуков авторы создают около 15 млн длинных, кратких и перефразированных подписей, а затем обучают контрастивную модель на том же звуковом материале, меняя именно плотность языковых описаний.

Метод. Qwen3-Omni получает звук и исходную подпись, формирует основное подробное описание, десять перефразировок, десять кратких вариантов и набор меток. В среднем приходится 23,9 подписи на запись. Сравниваются режимы с одной качественной подписью и со смесью описаний; отдельно измеряется поиск текста по звуку, когда достаточно найти любую верную подпись и когда требуется вернуть все девять вариантов.

Результаты. На AudioCaps поиск звука по тексту достигает R@5 79,5% и R@10 91,3% против 64,7% и 75,8% у LAION-CLAP. Для обратного поиска критерий «любая из девяти подписей» даёт R@5 71,3%, но строгий критерий «все девять» — только 9,5%. На непересекающемся Foley наборе R@1 растёт с 1,34% до 8,34%, что подтверждает перенос за пределы знакомых классов. В слепой оценке примерно половина подписей SonicCaps не получила ни одного отрицательного флага против менее четверти у сопоставленных источников.

Ограничения. Подписи синтетические и наследуют ошибки мультимодальной модели, а ограничения генерации лишь мягкие. Пересечение исходных аудиозаписей с ESC-50 может завышать часть результатов; доступны идентификаторы и подписи, но не единый свободно распространяемый звуковой архив. Внутренний коммерческий набор не воспроизводим извне.

Фишка из статьи. Девять правильных формулировок для одного звука превращают обычный поиск в проверку покрытия смыслового множества.

МодельТекст → звук R@5Текст → звук R@10Звук → любая подпись R@5Звук → все 9 подписей R@5
LAION-CLAP64,775,828,7
SonicCaps, смешанный режим79,591,371,39,5

Как это читать: обычный R@5 заметно растёт, но строгий столбец показывает, что модель ещё не считает разные описания полностью взаимозаменяемыми. Набор полезен именно для изучения этой неполной смысловой устойчивости, а не только как способ поднять одну метрику поиска.

Оригинальная статья на arXiv