Logbook: понимание звуковых событий в сверхдлинных записях
Logbook проверяет аудиомодели на непрерывных записях длительностью от десяти минут до шести дней, где нужно без пропусков разбить временную ось на события и описать каждое. Это полезнее обычного клипа: модель должна не только узнать звук, но и выбрать разумную гранулярность событий на очень длинном контексте.
Метод. Авторы сводят Ego4D, EgoLife и SINS к единой разметке с границами, классами и текстовыми фактами. Оцениваются 48 каскадов из шести аудиокапционеров и восьми текстовых моделей, четыре системы «из конца в конец», дообучение, увеличение окна и режим рассуждений. Метрики отдельно измеряют границы, избыточное число событий, покадровую точность и качество описаний.
Результаты. На Ego4D лучшая E2E-система Gemini 3.5 достигает покадровой точности 0,445, тогда как человеческий ориентир равен 0,646. Дообучение Qwen 3-o поднимает точность с 0,413 до 0,633 и снижает относительную ошибку числа событий с 1,344 до 0,681. Однако на SINS выигрыш меньше, а на описаниях EgoLife падает полнота: разметка содержит 48,67 факта на пять минут против 3,64 в обучающем Ego4D.
Ограничения. Границы предсказываются с минутным разрешением, а часть сильных систем закрыта. Один и тот же класс «событие» означает разные вещи в бытовом дневнике и эгоцентрическом видео. Автоматические текстовые метрики и парсинг жёсткой схемы могут смешивать понимание содержания с соблюдением формата.
Фишка из статьи. Увеличение контекста систематически делает события длиннее и реже, но не обязательно точнее. У Qwen 3-o на 45-минутном окне среднее событие растягивается почти на двадцать минут, что выглядит как потеря временной структуры.
| Окно E2E Qwen 3-o | Событий на 5 минут | Средняя длина события, с |
|---|---|---|
| 5 минут | 0,92 | 324 |
| 10 минут | 0,60 | 500 |
| 30 минут | 0,47 | 632 |
| 45 минут | 0,25 | 1175 |
| Эталон | 0,57 | 528 |
Как это читать: длинное окно не просто добавляет сведения, оно меняет предпочтительную гранулярность модели. Слишком длинный контекст заставляет объединять независимые эпизоды, поэтому качество временной разметки может ухудшиться даже при более полном «понимании» записи.