Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
Статья разбирает, почему звуковые языковые модели хорошо расшифровывают второй из двух последовательных фрагментов, но резко хуже отвечают о его содержании. Вывод тоньше обычного «контекст переполнен»: сведения о втором звуке остаются во внутренних представлениях, однако путь от них к ответу зависит от задачи и часто не используется.
Метод. Audio-Flamingo-Next, MiMo-Audio, Step-Audio-R1 и Qwen3-Omni получают один либо два последовательно склеенных фрагмента из SpeechCommands, GTZAN, ESC-50 и LibriSpeech. Затем авторы зануляют отдельные направления внимания: «звук → ответ», «звук → запрос» и «запрос → ответ». Дополнительно линейный классификатор проверяет, сохранился ли класс второго звука в представлении текстового запроса.
Результаты. У Audio-Flamingo-Next точность по SpeechCommands падает с 96,67% до 43,67%, по GTZAN — с 93,83% до 35,33%, по ESC-50 — с 97,67% до 54,33%; WER при этом меняется лишь с 1,68% до 1,86%. Qwen3-Omni устойчивее: 98,00% → 88,67%, 96,00% → 82,67% и 97,67% → 83,33%, а WER — 1,43% → 1,53%. Линейные пробы всё ещё извлекают классы с точностью примерно 68–90%, даже когда конечный ответ уже развалился.
Ограничения. Два звука идут последовательно и не перекрываются; длинные записи, шум и реальные смеси не проверены. Зануление внимания меняет нормировку и не доказывает единственность найденной цепи. Анализ проводится главным образом на успешно распознанных чистых примерах, поэтому механика собственно ошибок на склейке раскрыта не полностью.
Фишка из статьи. Контраст между распознаванием и вопросом о том же втором фрагменте отделяет хранение сведений от их использования. Особенно показательно, что у Audio-Flamingo-Next WER почти не меняется, хотя классификация события или жанра теряет примерно половину и больше абсолютной точности.
| Модель | SpeechCommands | GTZAN | ESC-50 | LibriSpeech WER |
|---|---|---|---|---|
| Audio-Flamingo-Next | 96,67% → 43,67% | 93,83% → 35,33% | 97,67% → 54,33% | 1,68% → 1,86% |
| Qwen3-Omni | 98,00% → 88,67% | 96,00% → 82,67% | 97,67% → 83,33% | 1,43% → 1,53% |
Как это читать: слева от стрелки один фрагмент, справа — нужный фрагмент после постороннего. Модель продолжает слышать слова, но не всегда направляет сохранённые звуковые признаки через запрос к ответу; это сбой маршрутизации, а не простая потеря входа.