Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA
Статья показывает, что для аудиовизуальных вопросов о музыке не обязательно перестраивать большую мультимодальную модель целиком. Достаточно подключить к Qwen2-VL-7B замороженный кодировщик Whisper и сохранить локальную временную структуру его признаков: именно разрешение по времени, а не размер проектора, оказывается главным фактором качества.
Метод. Музыкальная дорожка и вопрос, озвученный синтезатором речи, проходят через один замороженный Whisper-large-v3-turbo, но через разные линейные проекторы. К ним добавляются восемь кадров видео, после чего все группы признаков объединяются обычным самовниманием Qwen2-VL без отдельного модуля слияния. На первом этапе обучается только проектор музыки; на втором добавляется LoRA для слоев внимания языковой модели. Музыка обрабатывается 30-секундными фрагментами, каждый из которых дает 32 временных признака.
Результаты. На доступной части MUSIC-AVQA из 7 402 вопросов средняя точность трех запусков составляет 96,0% с разбросом 3,9 процентного пункта; отдельные результаты равны 97,3%, 91,6% и 99,1%. При одинаковых данных дообученная Qwen2.5-Omni-7B получает 80,9%, а вариант Whisper с 30 секундами музыки - 95,9%. Удаление музыки снижает точность с 97,3% до 77,2%, а удаление всего звука, включая озвученный вопрос, - до 53,7%.
Ограничения. Это не полный официальный тест MUSIC-AVQA, а подмножество роликов, которые удалось скачать; для обучения использовано лишь 8 000 пар. Многие абляции выполнены с одним начальным состоянием, а размах между тремя основными запусками достигает 7,5 пункта. Сравнение с PANNs и Qwen2.5-Omni остается системным: различаются предобучение и устройство кодировщиков. Видеоряд представлен только восемью кадрами.
Фишка из статьи. Полезнее всего не итоговая точность, а контролируемое сравнение способов сжатия звука. Глобально усредненные признаки почти стирают локальные события, даже если проектор намного крупнее.
| Звуковое представление | Признаков | Параметры проектора | Точность |
|---|---|---|---|
| PANNs, глобальное усреднение | 8 | 59 млн | 66,9% |
| PANNs, расширенный бюджет | 32 | 235 млн | 69,9% |
| Whisper, 30 с | 32 | 4,6 млн | 95,9% |
| Whisper, 60 с по фрагментам | 32-64 | 4,6 млн | 97,3% |
| Whisper, 60 с сжатые до 32 признаков | 32 | 4,6 млн | 70,5% |
Как это читать: преимущество Whisper исчезает, когда его последовательность грубо сжимают до тех же 32 позиций. Значит, модель отвечает не просто благодаря хорошему речевому предобучению, а благодаря сохраненным локальным временным событиям в музыке.