Аудиоязыковые модели Self-play Reasoning
Аудиоязыковые модели

Audio-Zero: самообучение аудиоязыковых моделей без разметки

+10.0 MMAR

Audio-Zero предлагает способ улучшать аудиоязыковую модель без ручных ответов к аудио: модель играет в contrastive listener game на парах неразмеченных сигналов. Интерес не в очередном supervised instruction tuning, а в том, что reward строится из самообъяснения, выбора отличающегося аудио и голосования. Это подходит для областей, где аудио много, а подробной разметки событий и причин мало.

Метод. Система берет пары аудио, заставляет модель описывать различия, угадывать odd sample и получать обратную связь по голосованию. Обучение делается через GRPO, но не на человеческих метках, а на внутренне проверяемой задаче различения. Авторы применяют схему к Qwen2-Audio-7B и Qwen2.5-Omni-7B, а оценивают на MMAU, MMAR и TREA, где есть вопросы про звук, музыку, речь, порядок событий, счет и длительность.

Результаты. Для Qwen2-Audio средний MMAU растет с 57.50 до 60.50, MMAR - с 41.20 до 49.10, TREA - с 40.67 до 48.00. Для Qwen2.5-Omni прирост крупнее: MMAU 68.30->76.30, MMAR 56.20->66.20, TREA 70.00->74.00. При этом Audio-Zero обходит label-dependent baselines вроде R1-AQA и Audio-Thinker на той же Qwen2-базе по MMAR и TREA.

Ограничения. Название label-free стоит читать аккуратно: модель все равно использует подготовленные пары аудио и уже сильную базовую способность понимать звук. Оценка в основном benchmark-ориентированная, без человеческой проверки качества объяснений и без длинных открытых диалогов. Также self-play reward может усиливать те признаки, которые удобны для выбора пары, но не обязательно важны для реального аудиоанализа.

Фишка из статьи. Абляция показывает, что важны не только GRPO и не только слушание, а полный цикл с attribution и vote-aware feedback. Без голосовой обратной связи результат устойчиво ниже.

ВариантQwen2 TREAQwen2 MMAUQwen2 MMARQwen2.5 TREAQwen2.5 MMAR
Vanilla GRPO44.6759.0044.5072.1760.80
Listening only45.3359.4045.8072.5061.90
Attribution only45.8359.1047.2072.8363.10
Без vote feedback45.5059.2046.8072.6762.70
Full Audio-Zero48.0060.5049.1074.0066.20

Как это читать: одиночные компоненты дают прирост, но полный self-play цикл лучше по всем трем наборам. Особенно заметен MMAR: для Qwen2.5 разрыв между full и vanilla GRPO составляет 5.40 пункта, хотя ручной разметки ответов модель не получает.

Оригинальная статья на arXiv