ASR Timestamps Robustness
ASR alignment

REDDIT: исправление timestamp drift в ASR без forgetting

mIoU 95.0%

REDDIT разбирает отдельный сбой autoregressive ASR: модель может правильно распознать слова, но после длинного участка тишины или non-speech сдвинуть временную ось decoded timestamps. Это важно для subtitle alignment, forced-alignment replacement и long-form transcription, где plausibly correct text уже недостаточен. Авторы предлагают не добавлять VAD или внешний aligner на inference, а отредактировать timestamp-token поведение модели через replay-based distribution editing.

Метод. Сначала базовая Whisper-like модель сама генерирует replay sequence для аудио с синтетически вставленными gaps; известные offsets дают новые targets только для timestamp positions. На non-timestamp tokens модель обучается match-ить frozen teacher distribution под тем же replay context, чтобы не забыть обычное ASR-поведение. Затем Stage 2 закрепляет исправленные timestamp transitions уже в edited-prefix context; в основном эксперименте обновляется только last cross-attention плюс layer norms, около 0.59M параметров для Whisper-tiny.

Результаты. На long-gap split у Whisper-tiny baseline mIoU падает до 38.7%, AAS растет до 4806 ms, Drift>10s достигает 26.7%, а hallucination rate 19.2%. REDDIT Full поднимает long-gap mIoU до 95.0%, снижает AAS до 66 ms, Drift>10s до 0.2% и hallucination rate до 1.8%. На mixed-gap OOD REDDIT Full снижает AAS с 2752 ms до 223 ms, при этом не вызывает catastrophic forgetting уровня SFT decoder, где CV-en MER доходит до 524.2%.

Ограничения. Основной repair-эксперимент сфокусирован на timestamp-token ASR, прежде всего Whisper-tiny и отдельной проверке Whisper-large-v3. Gap benchmark синтетически конструируется из VAD-trimmed spans и known offsets; это хорошо изолирует failure mode, но не заменяет полноценную оценку на реальных длинных записях с шумом, музыкой и overlapped speech. Метод также требует cached replay generation и pre-filtering, то есть это post-training procedure, а не бесплатная runtime correction.

Фишка из статьи. Самый сильный результат - не просто улучшение alignment, а retention trade-off. Обычный SFT decoder дает очень точные timestamps на target split, но резко портит поведение вне correction distribution; REDDIT жертвует небольшой долей target optimum, зато удерживает ASR.

МетодLong-gap mIoULong-gap AASDrift>10sHallucinationCV-en MER OOD
Base Whisper-tiny38.7%4806 ms26.7%19.2%49.1%
SFT decoder96.3%37 ms0.0%0.5%362.4% mixed-gap / 524.2% no-gap
REDDIT Full95.0%66 ms0.2%1.8%38.8% mixed-gap / 41.3% no-gap

Как это читать: SFT decoder почти идеально чинит targeted timestamps, но ломает распознавание на обычных OOD наборах. REDDIT близок к нему по temporal metrics, но остается рядом с base model по MER, что и делает replay/KL anchor центральным компонентом статьи.

Оригинальная статья на arXiv