ASR Test-time scaling Low-resource
ASR

LatentASR: latent test-time scaling для frozen ASR

CER -16.02%

LatentASR проверяет идею test-time scaling для ASR без полного дообучения распознавателя: frozen Qwen3-ASR-0.6B получает небольшой latent loop, который может несколько раз уточнять скрытые prefix-позиции перед транскрипцией. Интерес статьи в том, что стандартные методы адаптации на маленьком и шумном наборе из 500 utterances ухудшают WER, а латентный контур дает небольшой выигрыш на чистых тестах и заметный выигрыш на акцентной/code-switched речи. Главный ход - не переписывать backbone, а добавить около 4M trainable parameters и value head, который решает, стоит ли тратить дополнительное вычисление на конкретный utterance.

Метод. Модель добавляет к frozen ASR две обучаемые части: Latent Adapter итеративно обновляет несколько latent prefix позиций, а Value Head предсказывает, поможет ли следующий шаг и когда остановиться. Обновления стабилизированы bounded delta и scale-механизмами, чтобы латентный цикл не уводил frozen decoder с предобученного manifold. Обучение намеренно ограничено 500 разнотипными utterances; это делает эксперимент ближе к быстрой активации нового режима, а не к обычному large-scale fine-tuning.

Результаты. На FLEURS en-us baseline WER 4.900% снижается до 4.776%, то есть на 2.54% relative; на VoxPopuli en WER 9.038% снижается до 8.995%, на 0.47% relative. В тех же условиях full fine-tuning ухудшает FLEURS WER до 5.556%, LoRA до 6.467%, а prompt tuning фактически ломается. На шуме 0 dB LatentASR снижает WER на FLEURS с 29.81% до 29.42% и на VoxPopuli с 19.71% до 19.51%; на ASCEND accented/code-switched CER падает с 57.81% до 48.55%, то есть на 16.02% relative.

Ограничения. На чистых benchmarks эффект небольшой, поэтому метод стоит воспринимать как targeted robustness mechanism, а не как универсальный способ резко улучшить ASR. Эксперименты завязаны на Qwen3-ASR-0.6B и конкретный 500-utterance activation mix; устойчивость к другим ASR backbones и более длинному streaming-контексту нужно проверять отдельно. Часть stress-suite результатов неоднородна: на некоторых наборах WER чуть ухудшается, хотя aggregate становится лучше.

Фишка из статьи. Самая важная деталь - value head действительно распределяет compute по сложности входа. На чистом VoxPopuli он чаще пропускает latent refinement, а на ASCEND с акцентами и code-switching намного чаще включает полный N=4 путь.

DatasetSkip N=0N=1N=2N=3N=4
VoxPopuli clean60.2%24.0%6.7%2.8%6.2%
FLEURS clean47.0%23.2%7.0%4.6%18.2%
ASCEND accented22.3%30.3%8.2%5.1%34.1%

Как это читать: gain появляется не от равномерного “думай дольше над всем”. Система почти в 5.5 раза чаще использует полный latent budget на ASCEND, чем на VoxPopuli, и именно там получает основной выигрыш по CER.

Оригинальная статья на arXiv