Audio-Zero: самообучение аудиоязыковых моделей без разметки
Audio-Zero предлагает способ улучшать аудиоязыковую модель без ручных ответов к аудио: модель играет в contrastive listener game на парах неразмеченных сигналов. Интерес не в очередном supervised instruction tuning, а в том, что reward строится из самообъяснения, выбора отличающегося аудио и голосования. Это подходит для областей, где аудио много, а подробной разметки событий и причин мало.
Метод. Система берет пары аудио, заставляет модель описывать различия, угадывать odd sample и получать обратную связь по голосованию. Обучение делается через GRPO, но не на человеческих метках, а на внутренне проверяемой задаче различения. Авторы применяют схему к Qwen2-Audio-7B и Qwen2.5-Omni-7B, а оценивают на MMAU, MMAR и TREA, где есть вопросы про звук, музыку, речь, порядок событий, счет и длительность.
Результаты. Для Qwen2-Audio средний MMAU растет с 57.50 до 60.50, MMAR - с 41.20 до 49.10, TREA - с 40.67 до 48.00. Для Qwen2.5-Omni прирост крупнее: MMAU 68.30->76.30, MMAR 56.20->66.20, TREA 70.00->74.00. При этом Audio-Zero обходит label-dependent baselines вроде R1-AQA и Audio-Thinker на той же Qwen2-базе по MMAR и TREA.
Ограничения. Название label-free стоит читать аккуратно: модель все равно использует подготовленные пары аудио и уже сильную базовую способность понимать звук. Оценка в основном benchmark-ориентированная, без человеческой проверки качества объяснений и без длинных открытых диалогов. Также self-play reward может усиливать те признаки, которые удобны для выбора пары, но не обязательно важны для реального аудиоанализа.
Фишка из статьи. Абляция показывает, что важны не только GRPO и не только слушание, а полный цикл с attribution и vote-aware feedback. Без голосовой обратной связи результат устойчиво ниже.
| Вариант | Qwen2 TREA | Qwen2 MMAU | Qwen2 MMAR | Qwen2.5 TREA | Qwen2.5 MMAR |
|---|---|---|---|---|---|
| Vanilla GRPO | 44.67 | 59.00 | 44.50 | 72.17 | 60.80 |
| Listening only | 45.33 | 59.40 | 45.80 | 72.50 | 61.90 |
| Attribution only | 45.83 | 59.10 | 47.20 | 72.83 | 63.10 |
| Без vote feedback | 45.50 | 59.20 | 46.80 | 72.67 | 62.70 |
| Full Audio-Zero | 48.00 | 60.50 | 49.10 | 74.00 | 66.20 |
Как это читать: одиночные компоненты дают прирост, но полный self-play цикл лучше по всем трем наборам. Особенно заметен MMAR: для Qwen2.5 разрыв между full и vanilla GRPO составляет 5.40 пункта, хотя ручной разметки ответов модель не получает.