Распознавание речи LLM Задержка
Распознавание речи

ParaASR: быстрое распознавание речи с multi-token prediction

RTF 0.0053

ParaASR интересна как инженерная попытка снять главный тормоз современных систем распознавания речи на базе языкового декодера: авторегрессионный декодер большой модели обычно хорошо распознает, но медленно выдает токены. Авторы используют простое наблюдение: текст распознавания жестко привязан к акустическому входу, поэтому следующие слова часто можно предлагать пачкой, а затем безопасно подтверждать стандартной авторегрессионной проверкой. В результате 4B-декодер сохраняет качество и длинный контекст, но работает почти вдвое быстрее ближайшего LLM-ASR сравнения.

Метод. Система устроена как замороженный аудиоэнкодер, линейный адаптер и плотный Transformer-декодер на 4 млрд параметров. Акустические признаки идут с шагом 80 мс, а декодер имеет родное окно 32K и может обрабатывать до 30 минут речи за один проход. Главное отличие от обычного распознавания речи: после базового авторегрессионного обучения добавляются пять ветвей multi-token prediction, которые предлагают до шести текстовых токенов за шаг; на выводе принимается только подтвержденный префикс, поэтому ускорение не превращается в неконтролируемую генерацию.

Результаты. На китайских наборах средняя ошибка ParaASR составляет 2.97% против 3.17% у Qwen3-ASR-1.7B и 3.34% у Doubao. На английских наборах средний WER равен 3.68% против 3.85% у Qwen3-ASR, а на длинных записях средняя ошибка 3.70% против 4.20%. По скорости основной результат такой: real-time factor снижен до 0.0053, тогда как Qwen3-ASR показывает 0.0094, FunASR 0.0591, Doubao 0.0640, VibeVoice 0.1039. RTF 0.0053 означает, что час аудио декодируется примерно за 19 секунд вычислительного времени в указанной авторами конфигурации.

Ограничения. Это работа индустриального масштаба: обучение описано как сотни миллиардов токенов, поэтому воспроизводимость ограничена. Сравнение скорости дано на одной H800, а не как универсальная серверная кривая по устройствам и батчам. Длинный контекст до 30 минут не равен полноценному потоковому режиму с малой задержкой. Кроме того, в бенчмарках смешиваются CER для китайского и WER для английского, так что средние числа нужно читать внутри языковых групп.

Фишка из статьи. Самое полезное здесь не только низкий RTF, а то, насколько часто система действительно может принять предложенную пачку токенов. Абляция показывает: MTP почти не ухудшает качество, потому что будущие токены в распознавании речи гораздо более предсказуемы, чем в обычной генерации текста.

ВариантДоля принятия по ветвямСредне принятоКомментарий
MTP-30.96 / 0.88 / 0.803.6 из 4Большая часть трех будущих токенов проходит проверку
MTP-50.95 / 0.88 / 0.80 / 0.71 / 0.645.0 из 6Основной режим ParaASR
MTP-70.96 / 0.88 / 0.80 / 0.72 / 0.65 / 0.59 / 0.536.1 из 8Глубже заглядывает вперед, но хвост менее надежен

Как это читать: MTP-5 ускоряет декодирование не магически, а потому что в среднем пять из шести предложенных токенов можно принять без повторного полного шага декодера. При этом абляция качества почти плоская: включение MTP меняет среднюю ошибку на 0.00 п.п. для китайского, +0.04 п.п. для английского и +0.06 п.п. для длинных записей.

Оригинальная статья на arXiv