звуковые языковые модели сжатие контекста внимание
arXiv cs.SD

Внимание к звуковым токенам можно предсказать до запуска языковой модели

arXiv:2609.38878

Звуковые языковые модели тратят сотни токенов на минуту речи, но привычное прореживание по вниманию узнаёт важные токены только после дорогого запуска языковой части. Triage заранее предсказывает суммарное внимание всех слоёв простой линейной проекцией признаков звукового кодировщика, а при необходимости уточняет отбор после второго слоя.

Метод. Первый этап обучается без разметки и без вопроса: линейная карта ранжирует токены по ожидаемому полному вниманию. Для транскрипции из каждого временного сегмента сохраняется лучший токен, чтобы не потерять участок речи; для вопросов используется глобальный top-K и второй этап, смешивающий априорную оценку с реально наблюдённым вниманием второго слоя.

Результаты. На 11 из 13 исследованных звуковых языковых моделей ранговая корреляция предсказания с полным вниманием не ниже 0,69. При осторожном бюджете WER и точность остаются в пределах 0,04 от полного звука. При агрессивном бюджете Triage превосходит все ориентиры во всех 12 случаях транскрипции; в задачах выбора ответа при сжатии 2,2–5 раз средняя прибавка над DART равна 0,043.

Ограничения. Калибровка использует неразмеченный звук из близкого распределения, а разные задачи требуют разных правил отбора. Проверены четыре семейства моделей и шесть испытаний; длинный контекст оценивается расчётно по токенам, без полного анализа фактической задержки и памяти на каждом ускорителе.

Фишка из статьи. Простое равномерное прореживание тоже покрывает всю временную шкалу, но уступает Triage во всех 24 транскрипционных сравнениях. Значит, выигрыш создаёт сочетание двух ограничений: не терять ни один временной участок и внутри него выбирать токен по предсказанному вниманию.

РежимСжатиеНаблюдение
Транскрипция, осторожный1,11–2,00 разаМедианный прирост WER 0,017
Транскрипция, агрессивный1,18–2,86 разаЛучше всех ориентиров в 12 из 12 случаев
Выбор ответа, агрессивный2,22–5,00 раза+0,043 точности к DART в среднем
Расчётная длина Qwen2.5-Omni-3BОколо 2,8 раза21,8 → примерно 62 минуты

Как это читать: метод не обещает безусловного пятикратного сжатия для распознавания; его сильная сторона — автоматически подобрать допустимый бюджет и выбрать токены до дорогого прохода языковой модели.

Оригинальная статья на arXiv