ParaASR: быстрое распознавание речи с multi-token prediction
ParaASR интересна как инженерная попытка снять главный тормоз современных систем распознавания речи на базе языкового декодера: авторегрессионный декодер большой модели обычно хорошо распознает, но медленно выдает токены. Авторы используют простое наблюдение: текст распознавания жестко привязан к акустическому входу, поэтому следующие слова часто можно предлагать пачкой, а затем безопасно подтверждать стандартной авторегрессионной проверкой. В результате 4B-декодер сохраняет качество и длинный контекст, но работает почти вдвое быстрее ближайшего LLM-ASR сравнения.
Метод. Система устроена как замороженный аудиоэнкодер, линейный адаптер и плотный Transformer-декодер на 4 млрд параметров. Акустические признаки идут с шагом 80 мс, а декодер имеет родное окно 32K и может обрабатывать до 30 минут речи за один проход. Главное отличие от обычного распознавания речи: после базового авторегрессионного обучения добавляются пять ветвей multi-token prediction, которые предлагают до шести текстовых токенов за шаг; на выводе принимается только подтвержденный префикс, поэтому ускорение не превращается в неконтролируемую генерацию.
Результаты. На китайских наборах средняя ошибка ParaASR составляет 2.97% против 3.17% у Qwen3-ASR-1.7B и 3.34% у Doubao. На английских наборах средний WER равен 3.68% против 3.85% у Qwen3-ASR, а на длинных записях средняя ошибка 3.70% против 4.20%. По скорости основной результат такой: real-time factor снижен до 0.0053, тогда как Qwen3-ASR показывает 0.0094, FunASR 0.0591, Doubao 0.0640, VibeVoice 0.1039. RTF 0.0053 означает, что час аудио декодируется примерно за 19 секунд вычислительного времени в указанной авторами конфигурации.
Ограничения. Это работа индустриального масштаба: обучение описано как сотни миллиардов токенов, поэтому воспроизводимость ограничена. Сравнение скорости дано на одной H800, а не как универсальная серверная кривая по устройствам и батчам. Длинный контекст до 30 минут не равен полноценному потоковому режиму с малой задержкой. Кроме того, в бенчмарках смешиваются CER для китайского и WER для английского, так что средние числа нужно читать внутри языковых групп.
Фишка из статьи. Самое полезное здесь не только низкий RTF, а то, насколько часто система действительно может принять предложенную пачку токенов. Абляция показывает: MTP почти не ухудшает качество, потому что будущие токены в распознавании речи гораздо более предсказуемы, чем в обычной генерации текста.
| Вариант | Доля принятия по ветвям | Средне принято | Комментарий |
|---|---|---|---|
| MTP-3 | 0.96 / 0.88 / 0.80 | 3.6 из 4 | Большая часть трех будущих токенов проходит проверку |
| MTP-5 | 0.95 / 0.88 / 0.80 / 0.71 / 0.64 | 5.0 из 6 | Основной режим ParaASR |
| MTP-7 | 0.96 / 0.88 / 0.80 / 0.72 / 0.65 / 0.59 / 0.53 | 6.1 из 8 | Глубже заглядывает вперед, но хвост менее надежен |
Как это читать: MTP-5 ускоряет декодирование не магически, а потому что в среднем пять из шести предложенных токенов можно принять без повторного полного шага декодера. При этом абляция качества почти плоская: включение MTP меняет среднюю ошибку на 0.00 п.п. для китайского, +0.04 п.п. для английского и +0.06 п.п. для длинных записей.