Аудиовизуальные вопросы Whisper Временное разрешение
arXiv cs.SD

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

arXiv:2608.11329

Статья показывает, что для аудиовизуальных вопросов о музыке не обязательно перестраивать большую мультимодальную модель целиком. Достаточно подключить к Qwen2-VL-7B замороженный кодировщик Whisper и сохранить локальную временную структуру его признаков: именно разрешение по времени, а не размер проектора, оказывается главным фактором качества.

Метод. Музыкальная дорожка и вопрос, озвученный синтезатором речи, проходят через один замороженный Whisper-large-v3-turbo, но через разные линейные проекторы. К ним добавляются восемь кадров видео, после чего все группы признаков объединяются обычным самовниманием Qwen2-VL без отдельного модуля слияния. На первом этапе обучается только проектор музыки; на втором добавляется LoRA для слоев внимания языковой модели. Музыка обрабатывается 30-секундными фрагментами, каждый из которых дает 32 временных признака.

Результаты. На доступной части MUSIC-AVQA из 7 402 вопросов средняя точность трех запусков составляет 96,0% с разбросом 3,9 процентного пункта; отдельные результаты равны 97,3%, 91,6% и 99,1%. При одинаковых данных дообученная Qwen2.5-Omni-7B получает 80,9%, а вариант Whisper с 30 секундами музыки - 95,9%. Удаление музыки снижает точность с 97,3% до 77,2%, а удаление всего звука, включая озвученный вопрос, - до 53,7%.

Ограничения. Это не полный официальный тест MUSIC-AVQA, а подмножество роликов, которые удалось скачать; для обучения использовано лишь 8 000 пар. Многие абляции выполнены с одним начальным состоянием, а размах между тремя основными запусками достигает 7,5 пункта. Сравнение с PANNs и Qwen2.5-Omni остается системным: различаются предобучение и устройство кодировщиков. Видеоряд представлен только восемью кадрами.

Фишка из статьи. Полезнее всего не итоговая точность, а контролируемое сравнение способов сжатия звука. Глобально усредненные признаки почти стирают локальные события, даже если проектор намного крупнее.

Звуковое представлениеПризнаковПараметры проектораТочность
PANNs, глобальное усреднение859 млн66,9%
PANNs, расширенный бюджет32235 млн69,9%
Whisper, 30 с324,6 млн95,9%
Whisper, 60 с по фрагментам32-644,6 млн97,3%
Whisper, 60 с сжатые до 32 признаков324,6 млн70,5%

Как это читать: преимущество Whisper исчезает, когда его последовательность грубо сжимают до тех же 32 позиций. Значит, модель отвечает не просто благодаря хорошему речевому предобучению, а благодаря сохраненным локальным временным событиям в музыке.

Оригинальная статья на arXiv