BEST-RQ refinement: простая online-квантизация для ASR стала заметно лучше
Эта работа интересна тем, что улучшает BEST-RQ без превращения его в тяжёлый HuBERT-подобный pipeline с офлайн-кластеризацией и хранением pseudo-labels. Авторы оставляют online-постановку, но делают сами псевдометки более устойчивыми: заменяют случайную проекцию PCA, итеративно обновляют codebook и добавляют distillation-codebook из более богатых промежуточных представлений.
Метод. В обычном BEST-RQ masked speech model предсказывает дискретные цели, полученные через fixed random projection quantizer по log-Mel признакам. Слабое место — случайная и неподвижная квантизация: разные initialization дают разное качество, а targets остаются низкоуровневыми. В новой схеме PCA projection уменьшает произвольность проекции, iterative codebook refinement обновляет центры по ходу pretraining, а codebook distillation добавляет второй источник целей, который несёт больше временной структуры. Важный практический момент: все это остаётся online и не требует отдельного clustering pass по всему корпусу.
Результаты. Pretraining делали на LibriSpeech 960h, затем fine-tuning на 100, 10 и 1 часе supervised LibriSpeech. При 100h labeled data test-other WER снижается с 10.1 у BEST-RQ baseline до 8.8 при всех трёх модификациях, то есть примерно на 12% relative. В low-label режиме эффект не пропадает: при 10h test-other падает с 12.6 до 11.2, при 1h — с 16.9 до 14.8. Это важно именно для SSL: улучшение targets особенно ценно там, где supervised labels мало.
Ограничения. Проверка ограничена LibriSpeech и CTC/4-gram decoding pipeline; это чистая read-speech область, а не noisy conversational ASR. Авторы сравнивают несколько вариантов codebook, но не показывают масштабирование на multilingual или far-field данные. Кроме того, gains измерены на downstream ASR, а не на широком наборе speech tasks вроде diarization, emotion или spoken QA.
Фишка из статьи. Самый полезный результат — сравнение с “просто добавить больше random codebooks”. PCA + iterative refinement одного codebook даёт почти тот же WER, что 4–6 random codebooks, но без заметного увеличения времени эпохи.
| Схема pseudo-labels | # codebooks | Время/эпоха H100 | test-other WER ↓ |
|---|---|---|---|
| Random fixed BEST-RQ | 1 | 1.31 h | 10.1 |
| Random fixed | 4 | 1.71 h | 9.2 |
| Random fixed | 6 | 1.99 h | 9.2 |
| PCA + iterative refinement | 1 | 1.31 h | 9.2 |
| Iterative refinement + distillation | 2 | 1.56 h | 8.8 |
Как это читать: основная ценность не в ещё одном codebook, а в качестве targets. Один уточняемый codebook снимает большую часть проблемы random initialization, а distillation-codebook даёт дополнительный выигрыш дешевле, чем наращивать набор случайных квантизаторов.