аудиоязыковые модели адаптивные вычисления акустический анализ
arXiv cs.SD

AdaLoop: латентные рассуждения адаптивной глубины для аудиоязыковых моделей

arXiv:2610.06949

AdaLoop добавляет аудиоязыковой модели небольшой рекуррентный блок, который сам выбирает число проходов по звуковым признакам. Простому вопросу о содержании хватает одного-двух шагов, а сравнению высоты или громкости модель выделяет более глубокую обработку.

Метод. Один Transformer-блок повторно уточняет аудиопредставление с многомасштабным вниманием, а механизм остановки смотрит одновременно на звук и вопрос. Ponder-cost штрафует лишние итерации. Модуль не меняет аудиокодер и LLM, добавляет 2,4–2,9% параметров и обучается на 50 тыс. проверяемых пар вопрос–ответ.

Результаты. Средняя точность Qwen2.5-Omni растёт с 59,3% до 63,1%, Kimi-Audio с 53,3% до 56,7%, MiMo-Audio с 58,8% до 61,7%. На Qwen восприятие MMSU улучшается на 8,6 пункта. Сигнальные вопросы получают в среднем 5,7 итерации, семантические 2,6; общая средняя глубина 3,8 при максимуме восемь.

Ограничения. Аудио обрезается примерно до 30 секунд, а прирост измерен на задачах с коротким проверяемым ответом. Статья не сообщает реальную задержку и энергозатраты по сравнению с базовой моделью; экономия относительно фиксированной глубины выводится из числа итераций. Обучение требует четыре A100 80 ГБ.

Фишка из статьи. Фиксированные четыре прохода уже помогают, но именно выбор глубины даёт самый большой отдельный вклад. Удаление вопроса из механизма остановки почти так же вредно: сложность принадлежит паре «звук, вопрос», а не одному файлу.

Вариант Qwen2.5-OmniСредняя точность, %Потеря к AdaLoop
Базовая модель59,3-3,8
Фиксированная глубина 461,4-1,7
Без многомасштабного внимания61,9-1,2
Остановка без вопроса61,5-1,6
AdaLoop63,10

Как это читать: один и тот же звук может требовать разной глубины для «что сказано?» и «у кого выше основная частота?». Поэтому вопрос в контроллере остановки важнее, чем постоянное увеличение числа слоёв.

Оригинальная статья на arXiv