Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost
Работа объясняет, почему опережающее декодирование распознавания речи ломается не только из-за ошибок в следующем токене. Черновой модуль видит весь звук, но между проверками основной модели теряет текущую позицию в нём; авторы отделяют этот дрейф выравнивания от остальных ошибок и показывают, когда исправление действительно окупает свои вычисления.
Метод. К Qwen3-ASR и Voxtral подключается неглубокий черновой модуль в духе EAGLE-3, который предлагает несколько токенов, а основная модель проверяет их одним проходом. Вероятность принятия разделяется на первый токен после проверки и последующие токены. Положение оценивается по пику внимания к звуку и сверяется с независимым MMS Forced Aligner; окна одинаковой ширины, но с правильным и сдвинутым центром, дают причинную проверку роли позиции. AnchorDraft добавляет при обучении гауссову цель для внимания по выравниванию токенов и кадров, но не меняет граф вычислений при распознавании.
Результаты. Доступ к звуку мало меняет принятие первого токена, но поднимает принятие второго у Qwen с 0,25-0,32 до 0,54-0,58 и скорость с 1,14-1,30 до 1,41-1,55 раза относительно обычного декодирования. В тяжёлом режиме медианная ошибка позиции к поздним шагам достигает 21 кадра, тогда как внимание основной модели после проверки остаётся в пределах двух кадров. AnchorDraft ускоряет вариант 0,6B в среднем на 6,8%, а 1,7B - на 4,5%; максимальное изменение WER не превышает 0,01 процентного пункта. Совмещение обучения и исправления по вниманию даёт 1,562 раза против 1,472 у исходного чернового модуля.
Ограничения. Основные измерения относятся к коротким запросам, пакету из одного примера и A100; при росте пакета и длительности соотношение затрат меняется, а ускорение падает. AnchorDraft требует токенно-кадрового выравнивания во время обучения. Проверка жадная и теоретически точная только при точной арифметике: в пониженной точности совпадение токенов с отдельно вычисленной траекторией составляет 0,9705-0,9966. Позиционный дрейф объясняет лишь часть отвергнутых предложений и проверен главным образом на двух размерах Qwen.
Фишка из статьи. Более точный черновик может оказаться медленнее. Полноценный распознаватель почти безошибочно продолжает текст, но его собственные кодировщик и декодер стоят дороже, чем сэкономленные проверки.
| Черновой модуль | Дополнительный размер | Принятие продолжения | Скорость относительно обычного декодирования |
|---|---|---|---|
| Неглубокий модуль с доступом к звуку | 76,2 млн обучаемых параметров | 0,54-0,78 | 1,42-1,69 раза |
| Полный распознаватель | 600 млн и 1,46 ГиБ весов | 0,963-0,978 | 0,59-0,70 раза |
| AnchorDraft, Qwen 0,6B | тот же граф вывода | 0,512 -> 0,628 | +6,8% в среднем |
| AnchorDraft, Qwen 1,7B | тот же граф вывода | 0,679 -> 0,728 | +4,5% в среднем |
Как это читать: почти идеальное принятие не гарантирует ускорения. Нужна дешёвая модель, достаточно хорошо удерживающая позицию; поэтому небольшая добавочная цель при обучении полезнее второго полноценного распознавателя.