REDDIT: исправление timestamp drift в ASR без forgetting
REDDIT разбирает отдельный сбой autoregressive ASR: модель может правильно распознать слова, но после длинного участка тишины или non-speech сдвинуть временную ось decoded timestamps. Это важно для subtitle alignment, forced-alignment replacement и long-form transcription, где plausibly correct text уже недостаточен. Авторы предлагают не добавлять VAD или внешний aligner на inference, а отредактировать timestamp-token поведение модели через replay-based distribution editing.
Метод. Сначала базовая Whisper-like модель сама генерирует replay sequence для аудио с синтетически вставленными gaps; известные offsets дают новые targets только для timestamp positions. На non-timestamp tokens модель обучается match-ить frozen teacher distribution под тем же replay context, чтобы не забыть обычное ASR-поведение. Затем Stage 2 закрепляет исправленные timestamp transitions уже в edited-prefix context; в основном эксперименте обновляется только last cross-attention плюс layer norms, около 0.59M параметров для Whisper-tiny.
Результаты. На long-gap split у Whisper-tiny baseline mIoU падает до 38.7%, AAS растет до 4806 ms, Drift>10s достигает 26.7%, а hallucination rate 19.2%. REDDIT Full поднимает long-gap mIoU до 95.0%, снижает AAS до 66 ms, Drift>10s до 0.2% и hallucination rate до 1.8%. На mixed-gap OOD REDDIT Full снижает AAS с 2752 ms до 223 ms, при этом не вызывает catastrophic forgetting уровня SFT decoder, где CV-en MER доходит до 524.2%.
Ограничения. Основной repair-эксперимент сфокусирован на timestamp-token ASR, прежде всего Whisper-tiny и отдельной проверке Whisper-large-v3. Gap benchmark синтетически конструируется из VAD-trimmed spans и known offsets; это хорошо изолирует failure mode, но не заменяет полноценную оценку на реальных длинных записях с шумом, музыкой и overlapped speech. Метод также требует cached replay generation и pre-filtering, то есть это post-training procedure, а не бесплатная runtime correction.
Фишка из статьи. Самый сильный результат - не просто улучшение alignment, а retention trade-off. Обычный SFT decoder дает очень точные timestamps на target split, но резко портит поведение вне correction distribution; REDDIT жертвует небольшой долей target optimum, зато удерживает ASR.
| Метод | Long-gap mIoU | Long-gap AAS | Drift>10s | Hallucination | CV-en MER OOD |
|---|---|---|---|---|---|
| Base Whisper-tiny | 38.7% | 4806 ms | 26.7% | 19.2% | 49.1% |
| SFT decoder | 96.3% | 37 ms | 0.0% | 0.5% | 362.4% mixed-gap / 524.2% no-gap |
| REDDIT Full | 95.0% | 66 ms | 0.2% | 1.8% | 38.8% mixed-gap / 41.3% no-gap |
Как это читать: SFT decoder почти идеально чинит targeted timestamps, но ломает распознавание на обычных OOD наборах. REDDIT близок к нему по temporal metrics, но остается рядом с base model по MER, что и делает replay/KL anchor центральным компонентом статьи.