DCASE 2026 Task 5: аудио-вопросы пока далеки от потолка
Это обзор результата DCASE 2026 Task 5 по audio-dependent question answering: модель должна отвечать на вопросы, где правильный вариант зависит от содержимого аудио, а не только от текста вопроса. Работа полезна как срез состояния аудиоязыковых моделей: даже сильные открытые системы на скрытом наборе едва переваливают за 58% top-1 accuracy. Для оценки речевых и аудиоагентов это важный сигнал: масштаб и chain-of-thought сами по себе не закрывают задачу слухового понимания.
Метод. Задача устроена как multiple-choice QA с четырьмя вариантами ответа. Разработочный набор содержит 1,607 вопросов, скрытый ADQA-Bench - 3,000 вопросов, все проходят многоступенчатую фильтрацию и человеческую проверку корректности. Участники работали в двух треках: Overall до 100B суммарных параметров и Lightweight меньше 10B; ручная разметка скрытых evaluation items запрещена. Организаторы также дают baselines на открытых аудиоязыковых моделях, включая Qwen3-Omni-30B, MOSS-Audio и MiMo-Audio.
Результаты. На dev-наборе Qwen3-Omni-30B набирает 62.48%, Fun-Audio-Chat-8B 56.81%, MiMo-Audio-7B 54.57%, а случайный выбор 25.46%. На скрытом наборе лучший результат - 58.33% у Lim_CAU_4, ансамбля MOSS-Audio-8B-Thinking и Qwen3-Omni-30B с LoRA/GDPO, acoustic tagger и choice-permutation ensembling. Близко идут Lim_CAU_3 с 58.10%, легкий Lim_CAU_1 с 57.30% и Nam_IND_2 с 57.17%. Типичный провал dev->eval у топовых систем около 10-12 процентных пунктов, что указывает на переобучение к разработочному распределению или слабую устойчивость протокола.
Ограничения. Это challenge summary, поэтому сравнение методов не является чистой абляцией: команды различаются данными, prompts, дообучением, ансамблями и нормализацией ответов. Формат multiple-choice может включать артефакты вариантов, а top-1 accuracy не объясняет, какие акустические признаки реально поняты. Разрыв между dev и eval также показывает, что числа нельзя напрямую переносить на продуктовые аудио-диалоги.
Фишка из статьи. Самый интересный отрицательный результат: большой ансамбль почти не отрывается от легкой 8B версии той же команды. Это ставит под вопрос стратегию «просто добавить еще моделей».
| Система | Размер по протоколу | Dev | Eval | Падение |
|---|---|---|---|---|
| Lim_CAU_4: MOSS + Qwen3-Omni | 96.0B | 70.50% | 58.33% | -12.17 п.п. |
| Lim_CAU_3: MOSS views | 80.0B | 70.01% | 58.10% | -11.91 п.п. |
| Lim_CAU_1: MOSS 8B | 8.0B | 69.63% | 57.30% | -12.33 п.п. |
| Nam_IND_2: Qwen3-Omni | 60.0B | - | 57.17% | - |
Как это читать: у Lim_CAU переход от 8B к 96B дает только +1.03 п.п. на скрытом наборе. В этой задаче качество больше похоже на вопрос данных, нормализации и устойчивого вывода, чем на прямую функцию числа параметров.