Аудиоязыковые модели Benchmark DCASE
Аудиоязыковые модели

DCASE 2026 Task 5: аудио-вопросы пока далеки от потолка

58.33% top-1

Это обзор результата DCASE 2026 Task 5 по audio-dependent question answering: модель должна отвечать на вопросы, где правильный вариант зависит от содержимого аудио, а не только от текста вопроса. Работа полезна как срез состояния аудиоязыковых моделей: даже сильные открытые системы на скрытом наборе едва переваливают за 58% top-1 accuracy. Для оценки речевых и аудиоагентов это важный сигнал: масштаб и chain-of-thought сами по себе не закрывают задачу слухового понимания.

Метод. Задача устроена как multiple-choice QA с четырьмя вариантами ответа. Разработочный набор содержит 1,607 вопросов, скрытый ADQA-Bench - 3,000 вопросов, все проходят многоступенчатую фильтрацию и человеческую проверку корректности. Участники работали в двух треках: Overall до 100B суммарных параметров и Lightweight меньше 10B; ручная разметка скрытых evaluation items запрещена. Организаторы также дают baselines на открытых аудиоязыковых моделях, включая Qwen3-Omni-30B, MOSS-Audio и MiMo-Audio.

Результаты. На dev-наборе Qwen3-Omni-30B набирает 62.48%, Fun-Audio-Chat-8B 56.81%, MiMo-Audio-7B 54.57%, а случайный выбор 25.46%. На скрытом наборе лучший результат - 58.33% у Lim_CAU_4, ансамбля MOSS-Audio-8B-Thinking и Qwen3-Omni-30B с LoRA/GDPO, acoustic tagger и choice-permutation ensembling. Близко идут Lim_CAU_3 с 58.10%, легкий Lim_CAU_1 с 57.30% и Nam_IND_2 с 57.17%. Типичный провал dev->eval у топовых систем около 10-12 процентных пунктов, что указывает на переобучение к разработочному распределению или слабую устойчивость протокола.

Ограничения. Это challenge summary, поэтому сравнение методов не является чистой абляцией: команды различаются данными, prompts, дообучением, ансамблями и нормализацией ответов. Формат multiple-choice может включать артефакты вариантов, а top-1 accuracy не объясняет, какие акустические признаки реально поняты. Разрыв между dev и eval также показывает, что числа нельзя напрямую переносить на продуктовые аудио-диалоги.

Фишка из статьи. Самый интересный отрицательный результат: большой ансамбль почти не отрывается от легкой 8B версии той же команды. Это ставит под вопрос стратегию «просто добавить еще моделей».

СистемаРазмер по протоколуDevEvalПадение
Lim_CAU_4: MOSS + Qwen3-Omni96.0B70.50%58.33%-12.17 п.п.
Lim_CAU_3: MOSS views80.0B70.01%58.10%-11.91 п.п.
Lim_CAU_1: MOSS 8B8.0B69.63%57.30%-12.33 п.п.
Nam_IND_2: Qwen3-Omni60.0B-57.17%-

Как это читать: у Lim_CAU переход от 8B к 96B дает только +1.03 п.п. на скрытом наборе. В этой задаче качество больше похоже на вопрос данных, нормализации и устойчивого вывода, чем на прямую функцию числа параметров.

Оригинальная статья на arXiv