S-JEPA: мягкая GMM-кластеризация для self-supervised речевых энкодеров
S-JEPA — это попытка исправить одну из самых неприятных инженерных особенностей HuBERT-подобного self-supervised обучения речи: hard cluster labels и периодический offline reclustering. Вместо жесткого “этот frame принадлежит кластеру 17” модель учится предсказывать soft posterior distribution GMM. За счет этого она сохраняет акустическую неоднозначность, особенно на границах фонем и слов.
Проблема hard labels
Классический HuBERT-рецепт берет аудио, кластеризует признаки через k-means, а затем обучает encoder предсказывать discrete cluster ID на masked positions. Это оказалось очень продуктивным, но у подхода есть три системные проблемы.
- Границы категорий. На переходах между фонемами, внутри коартикуляции и при редуцированной речи acoustic frame часто не принадлежит одному классу “чисто”. Hard label заставляет модель выбросить эту неопределенность.
- Offline reclustering. После части обучения нужно заново прогонять корпус через encoder, пересобирать labels и продолжать обучение. Для больших датасетов это неудобно и плохо ложится на непрерывные distributed pipelines.
- Выбор слоя. В HuBERT/WavLM-подходах нужно решать, признаки какого transformer layer кластеризовать. Это гиперпараметр, который обычно подбирают руками.
Что делает S-JEPA
Авторы строят JEPA-style encoder-predictor: часть входных frames маскируется, encoder видит неполный сигнал, predictor должен восстановить target representation для masked positions. Но target здесь не waveform, не mel и не hard token, а soft posterior GMM. Loss — KL divergence между предсказанным распределением и распределением GMM.
Получается не “фонема X”, а “этот frame с высокой вероятностью похож на кластер X, но рядом есть конкурирующий кластер Y”. Для речи это важнее, чем выглядит: значимая информация часто живет именно в переходе, а не в стабильной середине звука.
Две фазы обучения
- Phase 1: используется фиксированный GMM по MFCC-признакам. Это дает стабильный начальный акустический словарь.
- Phase 2: GMM обновляется online уже по encoder features. Модель больше не останавливается на offline reclustering: target distribution едет вместе с encoder-ом.
- Adaptive layer selection: слой для GMM выбирается автоматически через effective rank — proxy на “богатство” представления. В их 6-layer encoder активный слой стартует около layer 2 и затем смещается к layer 4.
- Переключаемый EMA decay: EMA encoder не держат постоянно слишком медленным или слишком быстрым. Decay периодически переключается: в одном режиме GMM догоняет свежие признаки, в другом target vocabulary стабилизируется, чтобы online encoder мог учиться без сильного target drift.
Эксперименты
Предобучение идет на крупном английском корпусе: LibriLight плюс английская часть Granary, суммарно около 83 тыс. часов. Encoder небольшой по современным меркам — 6 transformer layers и 51.8M параметров. Оценка делается по SUPERB-протоколу с frozen encoder: поверх представлений обучаются маленькие task heads.
В sub-90M группе S-JEPA дает лучший ASR WER: 12.10% против 13.02% у DeCoAR 2.0 и 13.37% у DistilHuBERT. На emotion recognition — 64.83% accuracy, практически уровень HuBERT-Base при примерно 55% его параметров. На slot filling F1 83.05, то есть почти DeCoAR 2.0, но с заметно меньшим encoder-ом.
Важно не переинтерпретировать результат. S-JEPA не “побеждает WavLM Base+”: 95M-class модели все еще намного сильнее по ASR WER и slot filling. Смысл результата в другом: в под-90M классе появляется новый Pareto frontier без teacher distillation и без offline reclustering.
Почему soft targets не просто “размытость”
Самая интересная часть статьи — entropy analysis. Авторы показывают, что распределение uncertainty не превращается в равномерный шум. У модели есть два режима: уверенные frames с низкой entropy и отдельная масса frames около 1 bit, то есть около ситуации “почти равная конкуренция двух кластеров”. Более трети frames имеют entropy больше 1 bit.
Это сильный аргумент в пользу soft clustering: модель не просто неуверенна, она хранит структурированную неоднозначность. На границах слов/фонем rank-1 posterior падает, rank-2 поднимается, и это похоже на акустическую реальность речи, а не на ошибку классификатора.
Probe-анализ
На probing-задачах S-JEPA хорошо вытаскивает speaker, gender и chapter identity. На phoneme classification линейный probe у S-JEPA уступает WavLM, но MLP probe меняет картину: S-JEPA оказывается выше. Это можно читать так: фонетическая информация есть, но она лежит не совсем линейно. Для downstream-моделей это не обязательно плохо, если downstream head достаточно выразительный.
Ограничения
- Основная проверка сделана на английском SSL-корпусе; мультиязычная устойчивость пока не доказана.
- Base-class модели крупнее, но все еще заметно сильнее по ASR. S-JEPA — не замена WavLM Large, а интересная архитектурная альтернатива для компактного режима.
- Adaptive layer selection через effective rank выглядит красиво, но авторы осторожно говорят о корреляции, а не о доказанной причинности.
- Online GMM и переключаемый EMA decay усложняют training pipeline. Это не “просто заменить k-means на GMM”.
Практический вывод
Для production speech research это, пожалуй, самая важная из трех свежих статей. Она предлагает не очередной backbone побольше, а более аккуратную цель обучения: сохранять uncertainty там, где речь действительно неоднозначна. Если подход масштабируется на multilingual и noisy corpora, он может быть полезен как основа для ASR, emotion recognition, speaker tasks, diarization и anti-spoofing, где hard discretization часто выбрасывает тонкие акустические сигналы.
Фишка из статьи. S-JEPA не превращает речь в жесткие псевдометки. Вместо этого GMM posterior оставляет неопределенность на границах: в стабильных участках rank-1 компонент близок к 1.0, а около word boundaries сильные компоненты могут быть примерно 0.3-0.45. Это делает soft targets не шумом, а способом сохранить boundary ambiguity.
| Наблюдение про soft targets | Доля кадров | Интерпретация |
|---|---|---|
| Entropy > 0.5 bits | 58.8% | больше половины кадров не имеют совсем жесткой метки |
| Entropy > 1 bit | 36.6% | существенная неопределенность остается нормой |
| Entropy > 2 bits | 5.6% | сильно неоднозначные участки редки |
| Результат | S-JEPA | Комментарий |
|---|---|---|
| ASR без LM | 12.10% WER / 3.62% CER | сильный результат для модели <90M параметров |
| ASR с LM rescoring | 8.50% WER / 2.90% CER | LM хорошо монетизирует представления |
| Размер | 51.8M параметров | обучается напрямую, без teacher-модели |
| Emotion recognition | 64.83% accuracy | представление не схлопывается в чистую фонетику |
На probing видно, что S-JEPA особенно хорошо хранит speaker/chapter информацию: например, speaker ID доходит до 99.7%, а phoneme MLP поднимается до 88.0%, хотя linear phoneme probe ниже. Это похоже на более “слоистое” представление речи, где фонетика извлекается нелинейно.