ASR CTC Serving
ASR serving

Самоспекулятивное декодирование LLM-ASR через CTC-головы энкодера

2–3× speedup

Работа марта 2026 от европейской группы — практический инженерный шедевр, который, в отличие от громких релизов TTS, не получил публичного внимания, но решает критическую проблему серверной экономики LLM-ASR.

Контекст. Современные LLM-based ASR-модели (Canary-Qwen, Granite-Speech, Qwen3-ASR) достигают рекордного WER, но платят за это авторегрессивным декодированием на LLM-стороне. Энкодер обрабатывает аудио быстро (один проход), но затем LLM должен последовательно генерировать токены, каждый через полный forward-pass. На длинных транскриптах это становится узким местом — латентность растёт линейно с длиной выхода.

Идея спекулятивного декодирования (Leviathan et al., 2023) известна из LLM-инференса: использовать маленькую «draft»-модель для угадывания следующих N токенов, затем верифицировать большой моделью одним батчевым проходом. Совпало — приняли все N, ускорение в N раз. Не совпало — fallback на стандартное декодирование. В среднем даёт 2–3x ускорения.

Self-Speculative Decoding for LLM-based ASR с CTC Encoder Drafts (arXiv:2603.11243) предлагает не использовать отдельную draft-модель, а взять CTC-голову того же энкодера в качестве источника драфт-токенов. Это критическая разница с общим спекулятивным декодированием в LLM-мире. CTC-голова — это standalone decoder, который многие LLM-ASR архитектуры (Canary, например) уже включают для multi-task training. Обычно она не используется на инференсе (LLM-декодер даёт лучше WER), но её предсказания достаточно близки к LLM-декодеру, чтобы быть полезным драфтом.

Преимущества self-speculative подхода: (1) Нет дополнительной модели — CTC-голова уже в чекпоинте. (2) Драфт-токены приходят бесплатно после encoder forward-pass, который и так нужен. (3) Память: не нужен второй чекпоинт в VRAM (важно для serving на дешёвых GPU). (4) Структурная корреляция — CTC и LLM-декодер обучены на одних данных через один и тот же энкодер, что даёт более высокий acceptance rate, чем у разнородного драфта.

Где такая работа окупается. В serving-сценариях с большим QPS, где доминирует cost-per-stream: call-center транскрипция, real-time captioning, voice-search backends. На H100 с MIG-слайсами 2–3x ускорение означает не просто меньше latency для пользователя, а 2–3x больше параллельных стримов на одном устройстве — прямая экономия инфраструктуры.

Самый interesting побочный эффект — это работа также служит regularizer-ом во время обучения. Если CTC-голова и LLM-декодер сильно расходятся в предсказаниях, acceptance rate низкий, ускорения нет. Чтобы acceptance rate был высоким, эти головы должны согласовываться — что означает совместный сигнал в обучении. То есть подход не только инференс-ускорение, но и подталкивание к более когерентной обученной модели.

В контексте бэкграунда LLM-ASR гонки 2026 это маленький, но важный кирпич. Канарии и Парокиты как single-shot модели тормозят на длинных стримах — без таких ускорений их прод-применение остаётся непривлекательным. Прогноз: к концу 2026 какой-то вариант self-speculative или Medusa-подобной техники станет стандартом во всех serious LLM-ASR деплоях.

Фишка из статьи. Self-speculative decoding здесь устроен особенно экономно: CTC encoder используется как draft model, отдельный draft decoder не нужен. Сначала система принимает уверенный greedy CTC, затем проверяет гипотезу одним LLM forward pass, и только если проверка не прошла, откатывается к autoregressive decoding.

СтадияУсловиеЧто делает
1. CTC acceptframe entropies < τCTCпринимает greedy CTC как финальный ответ
2. LLM verifyCTC не достаточно уверенпроверяет CTC-гипотезу по token likelihood threshold τSLM
3. AR fallbackLLM verification failedдекодирует autoregressive от принятого CTC prefix
Benchmark avgFull AR WER / RTFxHigh accuracy WER / RTFx%C / %LHigh RTFx WER / RTFx
Open ASR5.75 / 5645.58 / 54814 / 476.56 / 2491
MLS5.47 / 6295.33 / 6993 / 385.73 / 2753
CommonVoice5.06 / 8245.03 / 9167 / 537.11 / 2393

Модельная конфигурация: Granite speech 4.0 с 1B LLM, 440M CTC encoder и 37M q-former projector; CTC encoder имеет 16 Conformer layers, hidden size 1024, 4-секундное block attention и 348 output characters. Важное ограничение: метод привязан к SLM с замороженным CTC encoder, а utterance-level verification означает, что при провале проверки большой кусок все равно уходит в AR decoding.

Оригинальная статья на arXiv