INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval
Один и тот же звуковой запрос может означать «найди продолжение разговора», «найди того же говорящего» или «найди такой же стиль и фон». INSPIRE впервые делает этот выбор частью самой задачи поиска: текстовая инструкция на лету определяет, какие свойства записи считать релевантными. Результат неприятен для нынешних универсальных моделей: семантика и акустические признаки лучше всего извлекаются разными конвейерами.
Метод. Набор объединяет DailyTalk, VCTK, Expresso и синтетическую часть: всего 680 звуковых запросов, 4080 пар «запрос - инструкция» и 17 225 документов. Критерии включают содержание, личность, стиль, окружающий звук и их сочетания. Сравниваются звуковые языковые модели, каскад «распознавание/описание - текстовый поиск», самоконтролируемые речевые представления HuBERT/WavLM и CLAP. Синтетическая часть строится из Natural Questions, пяти голосов, трёх эмоций и 15 звуков ESC-50, что позволяет точно задать сложные комбинации.
Результаты. Для продолжения диалога лучший Recall@10 даёт текстовый Qwen3-Embedding - 62,0%. Для поиска того же говорящего на VCTK лидирует WavLM с 17,5%, а Qwen3-Embedding получает лишь 1,88%. На Expresso HuBERT достигает 9,81%, тогда как крупные звуковые языковые модели в основном остаются около 0,3-2,2%. В многоатрибутной синтетической части лучший результат всего 7,02%. Добавление инструкции заметно помогает только специально обученным текстовым представлениям и почти не меняет звуковые модели на задачах личности и стиля.
Ограничения. Реальные части в основном разделяют свойства по разным корпусам, а самые сложные сочетания проверяются на синтетической речи. Инструкции сгенерированы GPT-5.2 из двадцати шаблонных вариантов на тип, поэтому языковое разнообразие ограничено. Стили Expresso охватывают пять категорий и четыре говорящих. Все методы используются без специализированного обучения на INSPIRE, так что низкие числа описывают готовые представления, но не предел задачи.
Фишка из статьи. Даже идеальные метаданные не являются универсальным лекарством. Они резко помогают простому BM25 найти того же говорящего, но мешают семантическому поиску, добавляя в текст нерелевантные признаки.
| Подзадача и модель | Recall@10 с описанием модели | Recall@10 с истинными метаданными |
|---|---|---|
| DailyTalk, Qwen3-Embedding | 62,00% | 58,00% |
| VCTK, BM25 | 1,25% | 53,13% |
| Expresso, Qwen3-Embedding | 0,75% | 2,69% |
| Синтетика, Qwen3-Embedding | 7,02% | 7,52% |
Как это читать: идентификатор говорящего является почти идеальным ключом для VCTK, поэтому BM25 взлетает. В DailyTalk те же дополнительные поля засоряют семантическое представление. Нужна модель, которая понимает инструкцию и выборочно включает только запрошенные свойства.