понимание аудио длинный контекст звуковые события
arXiv eess.AS

Logbook: понимание звуковых событий в сверхдлинных записях

arXiv:2610.07338

Logbook проверяет аудиомодели на непрерывных записях длительностью от десяти минут до шести дней, где нужно без пропусков разбить временную ось на события и описать каждое. Это полезнее обычного клипа: модель должна не только узнать звук, но и выбрать разумную гранулярность событий на очень длинном контексте.

Метод. Авторы сводят Ego4D, EgoLife и SINS к единой разметке с границами, классами и текстовыми фактами. Оцениваются 48 каскадов из шести аудиокапционеров и восьми текстовых моделей, четыре системы «из конца в конец», дообучение, увеличение окна и режим рассуждений. Метрики отдельно измеряют границы, избыточное число событий, покадровую точность и качество описаний.

Результаты. На Ego4D лучшая E2E-система Gemini 3.5 достигает покадровой точности 0,445, тогда как человеческий ориентир равен 0,646. Дообучение Qwen 3-o поднимает точность с 0,413 до 0,633 и снижает относительную ошибку числа событий с 1,344 до 0,681. Однако на SINS выигрыш меньше, а на описаниях EgoLife падает полнота: разметка содержит 48,67 факта на пять минут против 3,64 в обучающем Ego4D.

Ограничения. Границы предсказываются с минутным разрешением, а часть сильных систем закрыта. Один и тот же класс «событие» означает разные вещи в бытовом дневнике и эгоцентрическом видео. Автоматические текстовые метрики и парсинг жёсткой схемы могут смешивать понимание содержания с соблюдением формата.

Фишка из статьи. Увеличение контекста систематически делает события длиннее и реже, но не обязательно точнее. У Qwen 3-o на 45-минутном окне среднее событие растягивается почти на двадцать минут, что выглядит как потеря временной структуры.

Окно E2E Qwen 3-oСобытий на 5 минутСредняя длина события, с
5 минут0,92324
10 минут0,60500
30 минут0,47632
45 минут0,251175
Эталон0,57528

Как это читать: длинное окно не просто добавляет сведения, оно меняет предпочтительную гранулярность модели. Слишком длинный контекст заставляет объединять независимые эпизоды, поэтому качество временной разметки может ухудшиться даже при более полном «понимании» записи.

Оригинальная статья на arXiv