SSL для речи Дообучение SUPERB
SSL для речи

Дообучение речевых моделей зависит от версии предобучения

9 checkpoints

Статья ставит под сомнение привычный вывод "наш способ дообучения лучше", если он показан на одной предобученной речевой модели. Авторы показывают, что выигрыш рецепта может зависеть от конкретной версии предобучения и даже от seed, а не от универсально более высокого потолка качества. Это полезная методологическая работа для всех, кто сравнивает fine-tuning рецепты на wav2vec 2.0, HuBERT или WavLM.

Метод. Проверяются девять self-supervised речевых checkpoints из трех семейств: wav2vec 2.0, HuBERT и WavLM, от 94.7M до 317M параметров. Задачи берутся из SUPERB: speaker identification, intent classification и emotion recognition. Для каждой модели сравниваются восемь конфигураций дообучения: разные способы брать признаки из слоев и разные режимы заморозки. Лучшей считается не одна максимальная строка, а top group: все конфигурации, статистически не хуже максимума по парному exact McNemar test.

Результаты. На seed 1337 видны не просто малые перестановки, а настоящие провалы активации. Например, на SID для wavlm-base конфигурация F2-Z0 дает accuracy 0.7237, F2-Z1 0.7148, а F2-Z2 падает до 0.0006; при seed 2048 уже F2-Z0 падает до 0.0006, а F2-Z1 остается 0.6931. На IC многие конфигурации тоже дают аномальные 0.1044 или даже 0.0000 при смене seed. При этом для hubert-large-ll60k на emotion recognition все восемь конфигураций оказываются статистически неотличимы, то есть выбор рецепта почти ничего не меняет.

Ограничения. Это не универсальная теория дообучения всех речевых моделей: проверены только классификационные задачи SUPERB и один общий тренировочный конвейер. Нет генеративных речевых задач, распознавания речи или диаризации. Зато масштаб достаточный, чтобы вывод был неприятно практичным: одна контрольная точка и один seed слишком мало для заявления о превосходстве рецепта.

Фишка из статьи. Авторы предлагают читать такие результаты как "совпадение рецепта с предобученной моделью", а не как новый потолок качества. На одной и той же задаче смена только seed может перевести конфигурацию из успешной в почти нулевую.

ЗадачаМодельSeedF2-Z0F2-Z1F2-Z2
SIDwavlm-base13370.72370.71480.0006
SIDwavlm-base20480.00060.69310.0006
SIDwavlm-base73950.71010.65600.0006

Как это читать: если бы конфигурация действительно имела стабильно более высокий потолок, она не должна была бы обнуляться при неизменных данных и гиперпараметрах. Здесь провал больше похож на нестабильную активацию возможностей конкретного checkpoint.

Оригинальная статья на arXiv