ASR SSL BEST-RQ
Speech SSL

BEST-RQ refinement: простая online-квантизация для ASR стала заметно лучше

WER 8.8

Эта работа интересна тем, что улучшает BEST-RQ без превращения его в тяжёлый HuBERT-подобный pipeline с офлайн-кластеризацией и хранением pseudo-labels. Авторы оставляют online-постановку, но делают сами псевдометки более устойчивыми: заменяют случайную проекцию PCA, итеративно обновляют codebook и добавляют distillation-codebook из более богатых промежуточных представлений.

Метод. В обычном BEST-RQ masked speech model предсказывает дискретные цели, полученные через fixed random projection quantizer по log-Mel признакам. Слабое место — случайная и неподвижная квантизация: разные initialization дают разное качество, а targets остаются низкоуровневыми. В новой схеме PCA projection уменьшает произвольность проекции, iterative codebook refinement обновляет центры по ходу pretraining, а codebook distillation добавляет второй источник целей, который несёт больше временной структуры. Важный практический момент: все это остаётся online и не требует отдельного clustering pass по всему корпусу.

Результаты. Pretraining делали на LibriSpeech 960h, затем fine-tuning на 100, 10 и 1 часе supervised LibriSpeech. При 100h labeled data test-other WER снижается с 10.1 у BEST-RQ baseline до 8.8 при всех трёх модификациях, то есть примерно на 12% relative. В low-label режиме эффект не пропадает: при 10h test-other падает с 12.6 до 11.2, при 1h — с 16.9 до 14.8. Это важно именно для SSL: улучшение targets особенно ценно там, где supervised labels мало.

Ограничения. Проверка ограничена LibriSpeech и CTC/4-gram decoding pipeline; это чистая read-speech область, а не noisy conversational ASR. Авторы сравнивают несколько вариантов codebook, но не показывают масштабирование на multilingual или far-field данные. Кроме того, gains измерены на downstream ASR, а не на широком наборе speech tasks вроде diarization, emotion или spoken QA.

Фишка из статьи. Самый полезный результат — сравнение с “просто добавить больше random codebooks”. PCA + iterative refinement одного codebook даёт почти тот же WER, что 4–6 random codebooks, но без заметного увеличения времени эпохи.

Схема pseudo-labels# codebooksВремя/эпоха H100test-other WER ↓
Random fixed BEST-RQ11.31 h10.1
Random fixed41.71 h9.2
Random fixed61.99 h9.2
PCA + iterative refinement11.31 h9.2
Iterative refinement + distillation21.56 h8.8

Как это читать: основная ценность не в ещё одном codebook, а в качестве targets. Один уточняемый codebook снимает большую часть проблемы random initialization, а distillation-codebook даёт дополнительный выигрыш дешевле, чем наращивать набор случайных квантизаторов.

Оригинальная статья на arXiv