Самоконтролируемое обучение Мягкие цели Спектральная динамика
arXiv cs.LG

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

arXiv:2608.19084

Статья разбирает тонкий вопрос самоконтролируемого обучения речи: полезен ли «хвост» мягкой цели только величинами вероятностей или ещё и тем, каким компонентам GMM эти вероятности назначены. Авторы строят аккуратный контрфактический опыт, где главный компонент, его вероятность, сумма хвоста, энтропия и набор остальных значений сохранены. Меняется только соответствие между малым значением и конкретным акустическим компонентом, поэтому результат ближе к проверке механизма, чем обычное сравнение мягких и жёстких меток.

Метод. REAL SOFT использует исходное распределение по 100 компонентам GMM. FIXED-RANDPERM оставляет максимум на месте, но один раз перемешивает остальные вероятности отдельно для каждого физического кадра и повторяет это назначение при всех появлениях кадра. UNIFORM-TAIL равномерно распределяет оставшуюся массу. S-JEPA с шестислойным Transformer обучается на 20 часах LibriSpeech по 10 тыс. шагов с тремя начальными значениями. Затем кодировщик замораживается и проверяется двумя гребневыми регрессиями: насколько доступен исходный хвост GMM и насколько предсказуема кратковременная вторая разность логарифмического мел-спектра после вычитания линейного вклада полного текущего спектра и других признаков.

Результаты. REAL SOFT выиграл у обоих контролей по обеим пробам во всех трёх запусках — 12 из 12 направленных сравнений. Относительно FIXED-RANDPERM ошибка восстановления хвоста снизилась на 0,0676, 0,0129 и 0,0410; прирост контролируемого R² спектральной динамики составил 0,0262, 0,0247 и 0,0167. Для UNIFORM-TAIL направление осталось тем же. Сам исходный хвост не случаен: лишняя масса у соседнего фонетического перехода убывает с акустическим расстоянием между прототипами, корреляция Спирмена −0,4907. Два опыта с постепенным возвратом правильных назначений дали ожидаемый общий наклон, хотя один из них не был монотонным на промежуточных долях.

Ограничения. Исследуется одна архитектура, 20 часов чистой английской речи и только линейная доступность информации; улучшение WER, фонетики или устойчивости на последующей задаче не измеряется. Вмешательство меняет весь хвост сразу и не показывает, какие отношения между компонентами важны. Вторая стадия S-JEPA прослежена лишь для одной обычной траектории без контрфактического контроля, поэтому её изменения нельзя причинно приписать новой GMM. Нелинейная зависимость от текущего спектра также может оставаться после линейного вычитания.

Фишка из статьи. После перехода к сетевой GMM полезная информация сначала резко усиливается, а затем частично отступает. Одновременно веса смеси концентрируются на всё меньшем числе компонентов. Это редкий отрицательный результат: более долгое продолжение обучения не улучшает анализируемые свойства монотонно.

Точка второй стадииШагиDeepTailCE, ниже лучшеКонтролируемый R², выше лучшеКомпоненты с весом выше 10⁻⁶
P003,9760,158
P110 тыс.3,4910,24359
P250 тыс.3,6340,18512
P3100 тыс.3,6840,1689

Как это читать: на 10 тыс. шагов обе пробы достигают лучшего значения, но к 100 тыс. часть выигрыша исчезает, хотя результат остаётся лучше P0. Совпадение с концентрацией GMM интересно, но пока корреляционно: без параллельной контролируемой траектории нельзя утверждать, что именно схлопывание весов вызвало откат.

Оригинальная статья на arXiv