звуковые языковые модели интерпретируемость маршрутизация сведений
arXiv cs.SD

Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models

arXiv:2608.27026

Статья разбирает, почему звуковые языковые модели хорошо расшифровывают второй из двух последовательных фрагментов, но резко хуже отвечают о его содержании. Вывод тоньше обычного «контекст переполнен»: сведения о втором звуке остаются во внутренних представлениях, однако путь от них к ответу зависит от задачи и часто не используется.

Метод. Audio-Flamingo-Next, MiMo-Audio, Step-Audio-R1 и Qwen3-Omni получают один либо два последовательно склеенных фрагмента из SpeechCommands, GTZAN, ESC-50 и LibriSpeech. Затем авторы зануляют отдельные направления внимания: «звук → ответ», «звук → запрос» и «запрос → ответ». Дополнительно линейный классификатор проверяет, сохранился ли класс второго звука в представлении текстового запроса.

Результаты. У Audio-Flamingo-Next точность по SpeechCommands падает с 96,67% до 43,67%, по GTZAN — с 93,83% до 35,33%, по ESC-50 — с 97,67% до 54,33%; WER при этом меняется лишь с 1,68% до 1,86%. Qwen3-Omni устойчивее: 98,00% → 88,67%, 96,00% → 82,67% и 97,67% → 83,33%, а WER — 1,43% → 1,53%. Линейные пробы всё ещё извлекают классы с точностью примерно 68–90%, даже когда конечный ответ уже развалился.

Ограничения. Два звука идут последовательно и не перекрываются; длинные записи, шум и реальные смеси не проверены. Зануление внимания меняет нормировку и не доказывает единственность найденной цепи. Анализ проводится главным образом на успешно распознанных чистых примерах, поэтому механика собственно ошибок на склейке раскрыта не полностью.

Фишка из статьи. Контраст между распознаванием и вопросом о том же втором фрагменте отделяет хранение сведений от их использования. Особенно показательно, что у Audio-Flamingo-Next WER почти не меняется, хотя классификация события или жанра теряет примерно половину и больше абсолютной точности.

МодельSpeechCommandsGTZANESC-50LibriSpeech WER
Audio-Flamingo-Next96,67% → 43,67%93,83% → 35,33%97,67% → 54,33%1,68% → 1,86%
Qwen3-Omni98,00% → 88,67%96,00% → 82,67%97,67% → 83,33%1,43% → 1,53%

Как это читать: слева от стрелки один фрагмент, справа — нужный фрагмент после постороннего. Модель продолжает слышать слова, но не всегда направляет сохранённые звуковые признаки через запрос к ответу; это сбой маршрутизации, а не простая потеря входа.

Оригинальная статья на arXiv