TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models
TAG-Bench проверяет, умеет ли аудиоязыковая модель указать все интервалы, где встречается запрошенное слово, звук, тема или эмоция. Главная ценность набора — раздельная диагностика точности границ, пропущенных повторов и ошибок формата, которые одна средняя IoU обычно смешивает.
Метод. Набор содержит 1750 проверенных человеком пар «запрос–запись» общей длительностью 149,5 часа и восемь поднаборов от семисекундных слов до двадцатиминутных записей. В 22,1% запросов правильных интервалов несколько, в среднем 4,02. Для 21 системы считаются объединённая mIoU, Recall при трёх порогах, gIoU, ошибка середины, полнота разбора ответа и точность числа событий.
Результаты. FireRedAudio лидирует с mIoU 31,2 и Recall@0,7 21,5%; на двух длинных частях он получает 20,6 и 21,7 mIoU. Девять систем не достигают 5 mIoU. Даже лучший ответ почти всегда неполон для повторяющегося события: FireRedAudio недосчитывает интервалы в 91,0% таких запросов, а максимальная точность самого количества равна 13,2% у Step-Audio-R1.
Ограничения. На каждую запись задан только один вопрос, поэтому нельзя проверить согласованность модели внутри одного звука. Поднаборы одновременно различаются источником, длительностью, типом запроса и частотой повторов; их разрыв нельзя приписывать только длине контекста. Максимум составляет 20 минут, а свободный формат ответа смешивает собственно локализацию со следованием инструкции и работой разборщика.
Фишка из статьи. Три разных победителя показывают, почему единого места в таблице здесь недостаточно.
| Система | mIoU общая | Точность числа повторов | Характерный сбой |
|---|---|---|---|
| FireRedAudio | 31,2% | 4,7% | 91,0% недосчёта; 15,1% ответов без разбираемой метки времени |
| Gemini-3.1-Pro | 26,4% | 7,0% | в среднем 3,67 интервала, но 82,1% недосчёта |
| Step-Audio-R1 | 11,0% | 13,2% | 33,2% лишних интервалов на одиночных событиях |
Как это читать: FireRedAudio лучше ставит границы, Gemini чаще перечисляет несколько кандидатов, а Step-Audio-R1 выигрывает счёт частично за счёт склонности переоценивать число событий. Ни одна строка не свидетельствует о надёжном нахождении всех повторов.