Аудио LLM KV-кэш Длинный контекст
arXiv cs.AI

VoxZip: сжатие KV-кэша для длинного аудиоконтекста

arXiv:2608.08569

VoxZip решает практическую проблему аудио-языковых моделей: длинный аудиоконтекст быстро раздувает KV-кэш и делает вывод дорогим. Авторы предлагают training-free двухэтапное сжатие, где расшифровка речи служит семантическим якорем, а затем история дополнительно фильтруется по затухающему накопленному attention. Интересно, что метод не просто экономит память, а иногда улучшает точность за счет более плотных токенов.

Метод. Первый этап использует распознавание речи для привязки аудиотокенов к текстовым смысловым сегментам, после чего временно выравнивает, сжимает и сливает токены. Второй этап оставляет начальные служебные токены, недавнее окно и исторические токены с высоким decayed attention. В реализации для недавнего окна резервируется 20% бюджета KV-кэша, а метод проверяется на Qwen3-Omni-Instruct-30B.

Результаты. На long-context бенчмарках при 25% KV-бюджета VoxZip получает среднюю accuracy 69.75 против 67.07 у Full KV, то есть PRR 104.0%. При 15% бюджет все еще 67.14 и PRR 100.10%, при 5% - 61.31 и 91.41%. На general audio наборах 25% дает average 66.93 против 65.18 у Full KV. В измерении 64K context и 300 output tokens VoxZip снижает prefill с 2.26 до 1.30 с, peak memory с 235.93 до 70.68 GB и поднимает скорость с 2.10 до 4.06 tokens/s.

Ограничения. Метод зависит от качества распознавания речи и может хуже работать там, где смысл не текстовый: музыка, паралингвистика, шумовые события. Основные результаты получены на одном backbone, Qwen3-Omni-30B, и выбранных бенчмарках. ASR-якорь сам по себе отбрасывает интонацию, стиль и фоновые события, поэтому авторам приходится отдельно сохранять нерасшифрованные аудиофрагменты.

Фишка из статьи. Абляция показывает, что текстовая расшифровка полезна только как якорь, а не как замена аудио.

СравнениеЧислоЧто означает
Full KVAvg 78.70Vox-Infinity semantic subsets без сжатия
15% без semantic anchorAvg 46.08Обычное сжатие теряет длинный смысловой контекст
15% с semantic anchorAvg 82.27Якорь даже превосходит Full KV на этих поднаборах
10% без semantic anchorAvg 43.24Провал при более жестком бюджете
10% с semantic anchorAvg 76.53Качество остается близким к полной памяти

Как это читать: главная идея не в механическом удалении токенов, а в том, что сжатие аудио должно уважать временную семантику речи и одновременно сохранять нетекстовые аудиосигналы.

Оригинальная статья на arXiv