GLaS-JEPA: самоконтролируемое обучение речи с гауссовской регуляризацией без искусственных целей предсказания
GLaS-JEPA проверяет, можно ли обучить полезное речевое представление без кластерных меток, квантования и отдельного учителя для целей предсказания. Замаскированная ветвь предсказывает текущее представление незамаскированной ветви, а схлопывание предотвращает регуляризация распределения к изотропной гауссовской форме.
Метод. Кодировщик на 57 млн параметров обучается на 960 часах LibriSpeech. SIGReg сравнивает характеристические функции случайных проекций скрытых векторов с нормальным распределением; авторы показывают, что для речи важно регуляризовать общее распределение токенов, а не каждый временной индекс отдельно.
Результаты. При замороженном кодировщике модель получает WER 6,89% и CER 25,87% в заполнении слотов, заметно превосходя компактные модели без дистилляции. Однако WavLM Base и data2vec 2.0 остаются лучше по распознаванию речи, а точность распознавания эмоций 57,91% ниже 64,83% у S-JEPA.
Ограничения. Сравниваемые модели различаются архитектурой и объёмом предварительного обучения: S-JEPA использует около 83 тыс. часов. Масштабирование до 95 млн параметров ещё не завершено, поэтому работа подтверждает жизнеспособность цели, но не её преимущество при равном бюджете.
Фишка из статьи. Без SIGReg эффективный ранг скрытых представлений падает до единицы за несколько тысяч шагов. Даже способ формирования выборки для той же регуляризации заметно влияет на перенос: смешивание временных позиций уменьшает WER и DER без дополнительной цели.
| Регуляризация в модели 30 млн | WER ↓ | Точность эмоций ↑ | DER говорящих ↓ |
|---|---|---|---|
| По фиксированному времени | 13,99% | 57,92% | 7,65% |
| По смешанному общему распределению | 12,24% | 58,60% | 6,65% |
Как это читать: корреляция речевых кадров нарушает предположение о независимой выборке. Перемешивание не меняет число примеров или вычисления, но даёт регуляризатору более подходящую оценку общего распределения.