VoxZip: сжатие KV-кэша для длинного аудиоконтекста
VoxZip решает практическую проблему аудио-языковых моделей: длинный аудиоконтекст быстро раздувает KV-кэш и делает вывод дорогим. Авторы предлагают training-free двухэтапное сжатие, где расшифровка речи служит семантическим якорем, а затем история дополнительно фильтруется по затухающему накопленному attention. Интересно, что метод не просто экономит память, а иногда улучшает точность за счет более плотных токенов.
Метод. Первый этап использует распознавание речи для привязки аудиотокенов к текстовым смысловым сегментам, после чего временно выравнивает, сжимает и сливает токены. Второй этап оставляет начальные служебные токены, недавнее окно и исторические токены с высоким decayed attention. В реализации для недавнего окна резервируется 20% бюджета KV-кэша, а метод проверяется на Qwen3-Omni-Instruct-30B.
Результаты. На long-context бенчмарках при 25% KV-бюджета VoxZip получает среднюю accuracy 69.75 против 67.07 у Full KV, то есть PRR 104.0%. При 15% бюджет все еще 67.14 и PRR 100.10%, при 5% - 61.31 и 91.41%. На general audio наборах 25% дает average 66.93 против 65.18 у Full KV. В измерении 64K context и 300 output tokens VoxZip снижает prefill с 2.26 до 1.30 с, peak memory с 235.93 до 70.68 GB и поднимает скорость с 2.10 до 4.06 tokens/s.
Ограничения. Метод зависит от качества распознавания речи и может хуже работать там, где смысл не текстовый: музыка, паралингвистика, шумовые события. Основные результаты получены на одном backbone, Qwen3-Omni-30B, и выбранных бенчмарках. ASR-якорь сам по себе отбрасывает интонацию, стиль и фоновые события, поэтому авторам приходится отдельно сохранять нерасшифрованные аудиофрагменты.
Фишка из статьи. Абляция показывает, что текстовая расшифровка полезна только как якорь, а не как замена аудио.
| Сравнение | Число | Что означает |
|---|---|---|
| Full KV | Avg 78.70 | Vox-Infinity semantic subsets без сжатия |
| 15% без semantic anchor | Avg 46.08 | Обычное сжатие теряет длинный смысловой контекст |
| 15% с semantic anchor | Avg 82.27 | Якорь даже превосходит Full KV на этих поднаборах |
| 10% без semantic anchor | Avg 43.24 | Провал при более жестком бюджете |
| 10% с semantic anchor | Avg 76.53 | Качество остается близким к полной памяти |
Как это читать: главная идея не в механическом удалении токенов, а в том, что сжатие аудио должно уважать временную семантику речи и одновременно сохранять нетекстовые аудиосигналы.