SSL S-JEPA GMM
Speech SSL

S-JEPA: мягкая GMM-кластеризация для self-supervised речевых энкодеров

12.10% WER

S-JEPA — это попытка исправить одну из самых неприятных инженерных особенностей HuBERT-подобного self-supervised обучения речи: hard cluster labels и периодический offline reclustering. Вместо жесткого “этот frame принадлежит кластеру 17” модель учится предсказывать soft posterior distribution GMM. За счет этого она сохраняет акустическую неоднозначность, особенно на границах фонем и слов.

Проблема hard labels

Классический HuBERT-рецепт берет аудио, кластеризует признаки через k-means, а затем обучает encoder предсказывать discrete cluster ID на masked positions. Это оказалось очень продуктивным, но у подхода есть три системные проблемы.

  • Границы категорий. На переходах между фонемами, внутри коартикуляции и при редуцированной речи acoustic frame часто не принадлежит одному классу “чисто”. Hard label заставляет модель выбросить эту неопределенность.
  • Offline reclustering. После части обучения нужно заново прогонять корпус через encoder, пересобирать labels и продолжать обучение. Для больших датасетов это неудобно и плохо ложится на непрерывные distributed pipelines.
  • Выбор слоя. В HuBERT/WavLM-подходах нужно решать, признаки какого transformer layer кластеризовать. Это гиперпараметр, который обычно подбирают руками.

Что делает S-JEPA

Авторы строят JEPA-style encoder-predictor: часть входных frames маскируется, encoder видит неполный сигнал, predictor должен восстановить target representation для masked positions. Но target здесь не waveform, не mel и не hard token, а soft posterior GMM. Loss — KL divergence между предсказанным распределением и распределением GMM.

Получается не “фонема X”, а “этот frame с высокой вероятностью похож на кластер X, но рядом есть конкурирующий кластер Y”. Для речи это важнее, чем выглядит: значимая информация часто живет именно в переходе, а не в стабильной середине звука.

Две фазы обучения

  • Phase 1: используется фиксированный GMM по MFCC-признакам. Это дает стабильный начальный акустический словарь.
  • Phase 2: GMM обновляется online уже по encoder features. Модель больше не останавливается на offline reclustering: target distribution едет вместе с encoder-ом.
  • Adaptive layer selection: слой для GMM выбирается автоматически через effective rank — proxy на “богатство” представления. В их 6-layer encoder активный слой стартует около layer 2 и затем смещается к layer 4.
  • Переключаемый EMA decay: EMA encoder не держат постоянно слишком медленным или слишком быстрым. Decay периодически переключается: в одном режиме GMM догоняет свежие признаки, в другом target vocabulary стабилизируется, чтобы online encoder мог учиться без сильного target drift.

Эксперименты

Предобучение идет на крупном английском корпусе: LibriLight плюс английская часть Granary, суммарно около 83 тыс. часов. Encoder небольшой по современным меркам — 6 transformer layers и 51.8M параметров. Оценка делается по SUPERB-протоколу с frozen encoder: поверх представлений обучаются маленькие task heads.

В sub-90M группе S-JEPA дает лучший ASR WER: 12.10% против 13.02% у DeCoAR 2.0 и 13.37% у DistilHuBERT. На emotion recognition — 64.83% accuracy, практически уровень HuBERT-Base при примерно 55% его параметров. На slot filling F1 83.05, то есть почти DeCoAR 2.0, но с заметно меньшим encoder-ом.

Важно не переинтерпретировать результат. S-JEPA не “побеждает WavLM Base+”: 95M-class модели все еще намного сильнее по ASR WER и slot filling. Смысл результата в другом: в под-90M классе появляется новый Pareto frontier без teacher distillation и без offline reclustering.

Почему soft targets не просто “размытость”

Самая интересная часть статьи — entropy analysis. Авторы показывают, что распределение uncertainty не превращается в равномерный шум. У модели есть два режима: уверенные frames с низкой entropy и отдельная масса frames около 1 bit, то есть около ситуации “почти равная конкуренция двух кластеров”. Более трети frames имеют entropy больше 1 bit.

Это сильный аргумент в пользу soft clustering: модель не просто неуверенна, она хранит структурированную неоднозначность. На границах слов/фонем rank-1 posterior падает, rank-2 поднимается, и это похоже на акустическую реальность речи, а не на ошибку классификатора.

Probe-анализ

На probing-задачах S-JEPA хорошо вытаскивает speaker, gender и chapter identity. На phoneme classification линейный probe у S-JEPA уступает WavLM, но MLP probe меняет картину: S-JEPA оказывается выше. Это можно читать так: фонетическая информация есть, но она лежит не совсем линейно. Для downstream-моделей это не обязательно плохо, если downstream head достаточно выразительный.

Ограничения

  • Основная проверка сделана на английском SSL-корпусе; мультиязычная устойчивость пока не доказана.
  • Base-class модели крупнее, но все еще заметно сильнее по ASR. S-JEPA — не замена WavLM Large, а интересная архитектурная альтернатива для компактного режима.
  • Adaptive layer selection через effective rank выглядит красиво, но авторы осторожно говорят о корреляции, а не о доказанной причинности.
  • Online GMM и переключаемый EMA decay усложняют training pipeline. Это не “просто заменить k-means на GMM”.

Практический вывод

Для production speech research это, пожалуй, самая важная из трех свежих статей. Она предлагает не очередной backbone побольше, а более аккуратную цель обучения: сохранять uncertainty там, где речь действительно неоднозначна. Если подход масштабируется на multilingual и noisy corpora, он может быть полезен как основа для ASR, emotion recognition, speaker tasks, diarization и anti-spoofing, где hard discretization часто выбрасывает тонкие акустические сигналы.

Фишка из статьи. S-JEPA не превращает речь в жесткие псевдометки. Вместо этого GMM posterior оставляет неопределенность на границах: в стабильных участках rank-1 компонент близок к 1.0, а около word boundaries сильные компоненты могут быть примерно 0.3-0.45. Это делает soft targets не шумом, а способом сохранить boundary ambiguity.

Наблюдение про soft targetsДоля кадровИнтерпретация
Entropy > 0.5 bits58.8%больше половины кадров не имеют совсем жесткой метки
Entropy > 1 bit36.6%существенная неопределенность остается нормой
Entropy > 2 bits5.6%сильно неоднозначные участки редки
РезультатS-JEPAКомментарий
ASR без LM12.10% WER / 3.62% CERсильный результат для модели <90M параметров
ASR с LM rescoring8.50% WER / 2.90% CERLM хорошо монетизирует представления
Размер51.8M параметровобучается напрямую, без teacher-модели
Emotion recognition64.83% accuracyпредставление не схлопывается в чистую фонетику

На probing видно, что S-JEPA особенно хорошо хранит speaker/chapter информацию: например, speaker ID доходит до 99.7%, а phoneme MLP поднимается до 88.0%, хотя linear phoneme probe ниже. Это похоже на более “слоистое” представление речи, где фонетика извлекается нелинейно.

Оригинальная статья на arXiv