Дообучение речевых моделей зависит от версии предобучения
Статья ставит под сомнение привычный вывод "наш способ дообучения лучше", если он показан на одной предобученной речевой модели. Авторы показывают, что выигрыш рецепта может зависеть от конкретной версии предобучения и даже от seed, а не от универсально более высокого потолка качества. Это полезная методологическая работа для всех, кто сравнивает fine-tuning рецепты на wav2vec 2.0, HuBERT или WavLM.
Метод. Проверяются девять self-supervised речевых checkpoints из трех семейств: wav2vec 2.0, HuBERT и WavLM, от 94.7M до 317M параметров. Задачи берутся из SUPERB: speaker identification, intent classification и emotion recognition. Для каждой модели сравниваются восемь конфигураций дообучения: разные способы брать признаки из слоев и разные режимы заморозки. Лучшей считается не одна максимальная строка, а top group: все конфигурации, статистически не хуже максимума по парному exact McNemar test.
Результаты. На seed 1337 видны не просто малые перестановки, а настоящие провалы активации. Например, на SID для wavlm-base конфигурация F2-Z0 дает accuracy 0.7237, F2-Z1 0.7148, а F2-Z2 падает до 0.0006; при seed 2048 уже F2-Z0 падает до 0.0006, а F2-Z1 остается 0.6931. На IC многие конфигурации тоже дают аномальные 0.1044 или даже 0.0000 при смене seed. При этом для hubert-large-ll60k на emotion recognition все восемь конфигураций оказываются статистически неотличимы, то есть выбор рецепта почти ничего не меняет.
Ограничения. Это не универсальная теория дообучения всех речевых моделей: проверены только классификационные задачи SUPERB и один общий тренировочный конвейер. Нет генеративных речевых задач, распознавания речи или диаризации. Зато масштаб достаточный, чтобы вывод был неприятно практичным: одна контрольная точка и один seed слишком мало для заявления о превосходстве рецепта.
Фишка из статьи. Авторы предлагают читать такие результаты как "совпадение рецепта с предобученной моделью", а не как новый потолок качества. На одной и той же задаче смена только seed может перевести конфигурацию из успешной в почти нулевую.
| Задача | Модель | Seed | F2-Z0 | F2-Z1 | F2-Z2 |
|---|---|---|---|---|---|
| SID | wavlm-base | 1337 | 0.7237 | 0.7148 | 0.0006 |
| SID | wavlm-base | 2048 | 0.0006 | 0.6931 | 0.0006 |
| SID | wavlm-base | 7395 | 0.7101 | 0.6560 | 0.0006 |
Как это читать: если бы конфигурация действительно имела стабильно более высокий потолок, она не должна была бы обнуляться при неизменных данных и гиперпараметрах. Здесь провал больше похож на нестабильную активацию возможностей конкретного checkpoint.