аудиоязыковые модели временная привязка оценочный набор
arXiv eess.AS

TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

arXiv:2609.01542

TAG-Bench проверяет, умеет ли аудиоязыковая модель указать все интервалы, где встречается запрошенное слово, звук, тема или эмоция. Главная ценность набора — раздельная диагностика точности границ, пропущенных повторов и ошибок формата, которые одна средняя IoU обычно смешивает.

Метод. Набор содержит 1750 проверенных человеком пар «запрос–запись» общей длительностью 149,5 часа и восемь поднаборов от семисекундных слов до двадцатиминутных записей. В 22,1% запросов правильных интервалов несколько, в среднем 4,02. Для 21 системы считаются объединённая mIoU, Recall при трёх порогах, gIoU, ошибка середины, полнота разбора ответа и точность числа событий.

Результаты. FireRedAudio лидирует с mIoU 31,2 и Recall@0,7 21,5%; на двух длинных частях он получает 20,6 и 21,7 mIoU. Девять систем не достигают 5 mIoU. Даже лучший ответ почти всегда неполон для повторяющегося события: FireRedAudio недосчитывает интервалы в 91,0% таких запросов, а максимальная точность самого количества равна 13,2% у Step-Audio-R1.

Ограничения. На каждую запись задан только один вопрос, поэтому нельзя проверить согласованность модели внутри одного звука. Поднаборы одновременно различаются источником, длительностью, типом запроса и частотой повторов; их разрыв нельзя приписывать только длине контекста. Максимум составляет 20 минут, а свободный формат ответа смешивает собственно локализацию со следованием инструкции и работой разборщика.

Фишка из статьи. Три разных победителя показывают, почему единого места в таблице здесь недостаточно.

СистемаmIoU общаяТочность числа повторовХарактерный сбой
FireRedAudio31,2%4,7%91,0% недосчёта; 15,1% ответов без разбираемой метки времени
Gemini-3.1-Pro26,4%7,0%в среднем 3,67 интервала, но 82,1% недосчёта
Step-Audio-R111,0%13,2%33,2% лишних интервалов на одиночных событиях

Как это читать: FireRedAudio лучше ставит границы, Gemini чаще перечисляет несколько кандидатов, а Step-Audio-R1 выигрывает счёт частично за счёт склонности переоценивать число событий. Ни одна строка не свидетельствует о надёжном нахождении всех повторов.

Оригинальная статья на arXiv