AudioSpan: Spanning the Duration and Depth of Audio Comprehension
AudioSpan проверяет не короткое распознавание события, а понимание записей продолжительностью до 2,7 часа: модель должна найти свидетельство, связать удалённые фрагменты и только затем ответить. Самый важный вывод неприятен для нынешних звуковых языковых моделей: хороший текстовый решатель поверх подробной расшифровки заметно сильнее прямого анализа звука, значит узкое место находится до рассуждения.
Метод. Набор содержит 720 записей примерно на 600 часов, в среднем по 50 минут, на английском и китайском языках. Половина файлов изменена контролируемой вставкой «якоря». Для 3240 вопросов предусмотрены варианты ответа, открытые ответы и цепочки «восприятие — понимание — рассуждение»; цепочка засчитывается только до первой ошибки. Автоматический конвейер с несколькими проверяющими моделями используется для создания заданий, но каждый пример затем просматривает человек.
Результаты. GPT-5.4, получающий только подготовленное текстовое описание, достигает средней точности 80,2% и цепочного результата 61,4%. Лучший прямой закрытый вариант Qwen3.5-Omni-Plus получает 74,6% и 29,0%; сильнейшая открытая модель в таблице — 54,5% и 11,2%. При случайном выборе ожидаемый цепочный результат равен 10,9%, а не 25%, потому что ошибка обрывает дальнейшие звенья. С увеличением длительности качество закрытых моделей тоже падает: у Qwen3.5-Omni-Plus точность меняется с 79,2% на коротком уровне до 70,3% на длинном.
Ограничения. Вопросы рождаются из предварительных описаний, поэтому пропущенное на этом этапе событие уже не попадёт в оценку. Якорные изменения искусственны, языков только два, а открытые модели имеют разные пределы входа от 30 до 80 минут. Набор в основном проверяет речь и документальные записи, а не часовую музыку или сложные акустические сцены.
Фишка из статьи. Текстовый верхний предел превосходит прямые звуковые модели не только по ответу, но особенно по целостности многошаговой цепочки. Разрыв показывает: модель нередко умеет рассуждать по уже извлечённым фактам, но не удерживает сами факты и их временное положение в длинной записи.
| Система | Средняя точность | Открытый ответ по рубрике | Цепочный результат | Предел звука |
|---|---|---|---|---|
| GPT-5.4 по текстовому описанию | 80,2% | 56,5% | 61,4% | Текст |
| Qwen3.5-Omni-Plus | 74,6% | 50,8% | 29,0% | Без усечения |
| Qwen3-Omni, режим рассуждения | 54,5% | 30,1% | 11,2% | 80 мин |
Как это читать: текстовый вариант не является честной звуковой системой, а служит диагностическим потолком. Его преимущество говорит не «звук не нужен», а «сжатие длинного звука в пригодные для рассуждения сведения сейчас теряет больше, чем последующий языковой этап».