Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper
Stride-k удаляет каждый лишний звуковой токен в Whisper по фиксированному шагу, без обучения и вспомогательной сети. Простота полезна как диагностический опыт: половина токенов после кодировщика часто почти избыточна, но агрессивное прореживание входа ломается ровно там, где перестают перекрываться рецептивные поля.
Метод. После свёрточного входа или после кодировщика сохраняется каждый k-й токен; можно применить оба шага вместе. У стандартного Whisper 1500 звуковых токенов. При входном шаге 2 соседние сохранённые признаки всё ещё перекрываются примерно на 62% и не оставляют временных дыр, при шаге 3 перекрытие падает до 8,3%. Проверены пять размеров Whisper, LibriTTS, ESD, Common Voice и несколько речевых языковых моделей.
Результаты. Прореживание только выхода с k=2 почти сохраняет качество: на LibriTTS у Whisper large WER 4,31% → 4,30%. Совместный k=2 уменьшает число токенов с 1500 до 375 и вычисления large с 2577,71 до 1119,27 GFLOP, но WER становится 5,38% на LibriTTS и 21,56% вместо 11,66% на Common Voice. Реальная задержка распознавания large снижается лишь с 313,94 до 295,17 мс; у речевых языковых моделей уменьшение составляет 19,6–27,4%.
Ограничения. Способ опирается на перекрывающиеся оконные признаки Whisper и плохо переносится на кодировщики сырого сигнала. Он требует доступа к внутренним токенам и потому не подходит закрытым API. Обучение не компенсирует потерю информации; на шуме 0 дБ разрыв WER совместного варианта достигает 28,6 пункта у large и 57,5 у small.
Фишка из статьи. Снижение числа операций не превращается в такое же ускорение распознавания. У Whisper large совместное прореживание убирает 75% токенов и 56,6% GFLOP, но весь конвейер ускоряется примерно на 6%: значительная часть времени находится вне сокращённого внимания.
| Показатель Whisper large | Обычный вариант | Совместный stride-2 | Изменение |
|---|---|---|---|
| Звуковые токены | 1500 | 375 | −75,0% |
| Вычисления | 2577,71 GFLOP | 1119,27 GFLOP | −56,6% |
| Полное время распознавания | 313,94 мс | 295,17 мс | −6,0% |
| WER, LibriTTS | 4,31% | 5,38% | +1,07 п.п. |
| WER, Common Voice | 11,66% | 21,56% | +9,90 п.п. |
Как это читать: GFLOP описывает сокращённую математику модели, а полное время включает подготовку, память, декодирование и другие узкие места. Метод особенно привлекателен внутри больших речевых моделей, но для обычного Whisper выигрыш скорости может не окупить потерю устойчивости.