Звуковые языковые модели Выравнивание модальностей Обучение без инструкций
arXiv cs.CL

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

arXiv:2608.18132

Работа проверяет, можно ли соединить готовый звуковой кодировщик и готовую языковую модель без обучения на наборах вопросов и инструкций. Обучается только проектор между двумя замороженными моделями, а целевые ответы языковая модель сама строит из подписей к звуку. Результат интересен не столько громким тезисом «достаточно выравнивания», сколько хорошо показанной границей: простой интерфейс действительно переносит многие готовые способности языковой модели, но не восстанавливает звуковую информацию, потерянную кодировщиком.

Метод. Звуковой кодировщик выдаёт последовательность признаков, двухслойный MLP объединяет соседние кадры и переводит их в пространство входных векторов Qwen2.5-7B-Instruct. Сам кодировщик и Qwen заморожены; в варианте с Whisper-large-v2 обучаются 31,2 млн параметров проектора. Для каждой записи берётся подпись, та же языковая модель превращает её в свободный ответ «слушателя», после чего проектор учится вызывать такой ответ непосредственно по звуку, без задания конкретной задачи. Базовая выборка содержит 576,8 тыс. примеров, или около 1,6 тыс. часов; обучение в 600 тыс. шагов заняло примерно 46 часов на восьми A100.

Результаты. Связка AudioSet-Zipformer с Qwen набрала 68,2 на MMAU test-mini и 66,3 на полном тесте, включая 80,8/77,4 на звуковых событиях. На MMAU-Pro её средний результат 52,8 немного выше Audio-Flamingo 3 с 51,7, хотя последний обучался на 26,7 млн примеров и 54,4 тыс. часов; на обычном MMAU Audio-Flamingo 3 всё же заметно сильнее, 72,4 против 66,3. Вариант с Whisper лучше на речи: 60,4/60,1 на речевой части MMAU и 50,6 на MMSU, но уступает специализированным ALARM и Qwen2.5-Omni на 10–17 пунктов. Особенно показательно следование инструкциям на MMAU-Pro: 72,6 у варианта с Whisper против 61,3 у лучшей из приведённых открытых базовых моделей.

Ограничения. Проверены только звук, модели около 7–8 млрд параметров и четыре теста; в MMAU-Pro авторы дополнительно исключили записи длиннее минуты. Заголовок не следует понимать как доказательство отказа от последующего обучения вообще: речевые задачи остаются слабым местом, а дополнительная настройка на речевых вопросах улучшает их ценой общих звуковых навыков. Подход также не дешёв в абсолютном смысле и зависит от качества автоматически построенных ответов. Если кодировщик не сохранил просодию, пространственные признаки или тонкую фонетику, проектор их не создаст.

Фишка из статьи. Перенос на новое поколение языковой модели работает только тогда, когда ответы для обучения сгенерированы этой же моделью. Простая замена Qwen2.5 на Qwen3 при старых целевых ответах заметно портит результат, хотя кодировщик, данные и устройство проектора не меняются.

Языковая модельГенератор целевых ответовMMAU, среднееMMARMMAU-Pro, среднее
Qwen2.5-7BQwen2.5-7B61,2048,4047,32
Qwen3-8BQwen2.5-7B54,7048,1040,54
Qwen3-8BQwen3-8B60,6049,8048,31

Как это читать: «лёгкая переносимость» означает переобучение проектора с согласованными ответами, а не бесплатную замену языковой модели. Несогласованность стоит 5,9 пункта на MMAU и 7,8 пункта на MMAU-Pro; после повторной генерации ответов Qwen3 возвращается в прежний диапазон.

Оригинальная статья на arXiv