LatentASR: latent test-time scaling для frozen ASR
LatentASR проверяет идею test-time scaling для ASR без полного дообучения распознавателя: frozen Qwen3-ASR-0.6B получает небольшой latent loop, который может несколько раз уточнять скрытые prefix-позиции перед транскрипцией. Интерес статьи в том, что стандартные методы адаптации на маленьком и шумном наборе из 500 utterances ухудшают WER, а латентный контур дает небольшой выигрыш на чистых тестах и заметный выигрыш на акцентной/code-switched речи. Главный ход - не переписывать backbone, а добавить около 4M trainable parameters и value head, который решает, стоит ли тратить дополнительное вычисление на конкретный utterance.
Метод. Модель добавляет к frozen ASR две обучаемые части: Latent Adapter итеративно обновляет несколько latent prefix позиций, а Value Head предсказывает, поможет ли следующий шаг и когда остановиться. Обновления стабилизированы bounded delta и scale-механизмами, чтобы латентный цикл не уводил frozen decoder с предобученного manifold. Обучение намеренно ограничено 500 разнотипными utterances; это делает эксперимент ближе к быстрой активации нового режима, а не к обычному large-scale fine-tuning.
Результаты. На FLEURS en-us baseline WER 4.900% снижается до 4.776%, то есть на 2.54% relative; на VoxPopuli en WER 9.038% снижается до 8.995%, на 0.47% relative. В тех же условиях full fine-tuning ухудшает FLEURS WER до 5.556%, LoRA до 6.467%, а prompt tuning фактически ломается. На шуме 0 dB LatentASR снижает WER на FLEURS с 29.81% до 29.42% и на VoxPopuli с 19.71% до 19.51%; на ASCEND accented/code-switched CER падает с 57.81% до 48.55%, то есть на 16.02% relative.
Ограничения. На чистых benchmarks эффект небольшой, поэтому метод стоит воспринимать как targeted robustness mechanism, а не как универсальный способ резко улучшить ASR. Эксперименты завязаны на Qwen3-ASR-0.6B и конкретный 500-utterance activation mix; устойчивость к другим ASR backbones и более длинному streaming-контексту нужно проверять отдельно. Часть stress-suite результатов неоднородна: на некоторых наборах WER чуть ухудшается, хотя aggregate становится лучше.
Фишка из статьи. Самая важная деталь - value head действительно распределяет compute по сложности входа. На чистом VoxPopuli он чаще пропускает latent refinement, а на ASCEND с акцентами и code-switching намного чаще включает полный N=4 путь.
| Dataset | Skip N=0 | N=1 | N=2 | N=3 | N=4 |
|---|---|---|---|---|---|
| VoxPopuli clean | 60.2% | 24.0% | 6.7% | 2.8% | 6.2% |
| FLEURS clean | 47.0% | 23.2% | 7.0% | 4.6% | 18.2% |
| ASCEND accented | 22.3% | 30.3% | 8.2% | 5.1% | 34.1% |
Как это читать: gain появляется не от равномерного “думай дольше над всем”. Система почти в 5.5 раза чаще использует полный latent budget на ASCEND, чем на VoxPopuli, и именно там получает основной выигрыш по CER.