UGP: обучение новых языков в Whisper без забывания
Статья про больное место многоязычного распознавания речи: когда Whisper дообучают на новых малоресурсных языках, качество на старых языках может резко просесть. Авторы предлагают Unified Gradient Projection, где текущий градиент сравнивается с языково-сбалансированным градиентом replay-данных и при конфликте проецируется в безопасное направление. Интересно, что на Whisper-large-v3 метод почти убирает среднее забывание, не превращаясь в слишком консервативное обучение.
Метод. В replay-буфере для прошлых языков авторы на каждом шаге берут одинаковое число примеров на язык и считают общий reference gradient. Если скалярное произведение текущего градиента с reference gradient отрицательное, текущий градиент вычитается вдоль конфликтной компоненты. Это похоже на A-GEM, но с важным отличием: ограничение строится не из случайной смеси, где доминирующий язык может перетянуть направление, а из языково-сбалансированной выборки. UGP объединяет такую проекцию с обычным experience replay; для medium и large-v3 энкодер заморожен, обновляются декодер и embeddings, для small применяется полное дообучение.
Результаты. Основной набор: новые языки Malay, Indonesian, Filipino, Javanese, Māori; replay-языки Thai, Vietnamese, English, French. На Whisper-large-v3 полное дообучение дает TWER 11.40%, но FWER 8.98%, то есть старые языки забываются. Standard ER снижает FWER до 4.11%, но UGP доводит его до 0.04% при TWER 12.91% и лучшем среднем AWER 9.80%. На Whisper-small UGP тоже лучший по AWER: 25.81% против 29.38% у ER и 48.63% у A-GEM.
Ограничения. Метод требует хранить replay-примеры и знать разметку языков, поэтому это не сценарий «дообучить без старых данных». Часть результатов завязана на FLEURS и выбранные группы языков; для Thai используется CER из-за отсутствия пробелов, что усложняет прямое чтение усреднений. Абляция extreme low-resource для 50h-5h проведена только на Whisper-small, а не на large-v3, вероятно из-за вычислительной цены.
Фишка из статьи. Абляция на Whisper-large-v3 хорошо показывает, что replay и проекция решают разные части проблемы: один дает пластичность, другая подавляет разрушительные направления обновления.
| Конфигурация | TWER | FWER |
|---|---|---|
| Vanilla FT | 13.48% | 13.79% |
| Freeze encoder + augment | 19.04% | 2.77% |
| Base + Standard ER | 12.86% | 4.11% |
| Base + Standard A-GEM | 22.20% | 9.78% |
| Base + Unified Projection без ER | 15.80% | 4.20% |
| UGP: Unified Projection + ER | 12.91% | 0.04% |
Как это читать: заморозка энкодера резко снижает забывание, но ухудшает новые языки. ER возвращает пластичность, но сам по себе не удерживает старые языки достаточно хорошо. Полная UGP-комбинация сохраняет почти тот же TWER, что ER, и почти обнуляет FWER.