Whisper Малоресурсные языки Continual learning
Непрерывное обучение

UGP: обучение новых языков в Whisper без забывания

FWER 0.04%

Статья про больное место многоязычного распознавания речи: когда Whisper дообучают на новых малоресурсных языках, качество на старых языках может резко просесть. Авторы предлагают Unified Gradient Projection, где текущий градиент сравнивается с языково-сбалансированным градиентом replay-данных и при конфликте проецируется в безопасное направление. Интересно, что на Whisper-large-v3 метод почти убирает среднее забывание, не превращаясь в слишком консервативное обучение.

Метод. В replay-буфере для прошлых языков авторы на каждом шаге берут одинаковое число примеров на язык и считают общий reference gradient. Если скалярное произведение текущего градиента с reference gradient отрицательное, текущий градиент вычитается вдоль конфликтной компоненты. Это похоже на A-GEM, но с важным отличием: ограничение строится не из случайной смеси, где доминирующий язык может перетянуть направление, а из языково-сбалансированной выборки. UGP объединяет такую проекцию с обычным experience replay; для medium и large-v3 энкодер заморожен, обновляются декодер и embeddings, для small применяется полное дообучение.

Результаты. Основной набор: новые языки Malay, Indonesian, Filipino, Javanese, Māori; replay-языки Thai, Vietnamese, English, French. На Whisper-large-v3 полное дообучение дает TWER 11.40%, но FWER 8.98%, то есть старые языки забываются. Standard ER снижает FWER до 4.11%, но UGP доводит его до 0.04% при TWER 12.91% и лучшем среднем AWER 9.80%. На Whisper-small UGP тоже лучший по AWER: 25.81% против 29.38% у ER и 48.63% у A-GEM.

Ограничения. Метод требует хранить replay-примеры и знать разметку языков, поэтому это не сценарий «дообучить без старых данных». Часть результатов завязана на FLEURS и выбранные группы языков; для Thai используется CER из-за отсутствия пробелов, что усложняет прямое чтение усреднений. Абляция extreme low-resource для 50h-5h проведена только на Whisper-small, а не на large-v3, вероятно из-за вычислительной цены.

Фишка из статьи. Абляция на Whisper-large-v3 хорошо показывает, что replay и проекция решают разные части проблемы: один дает пластичность, другая подавляет разрушительные направления обновления.

КонфигурацияTWERFWER
Vanilla FT13.48%13.79%
Freeze encoder + augment19.04%2.77%
Base + Standard ER12.86%4.11%
Base + Standard A-GEM22.20%9.78%
Base + Unified Projection без ER15.80%4.20%
UGP: Unified Projection + ER12.91%0.04%

Как это читать: заморозка энкодера резко снижает забывание, но ухудшает новые языки. ER возвращает пластичность, но сам по себе не удерживает старые языки достаточно хорошо. Полная UGP-комбинация сохраняет почти тот же TWER, что ER, и почти обнуляет FWER.

Оригинальная статья на arXiv