Последовательное освоение новых областей для порождающего улучшения речи
DIL-GenSE решает практическую проблему: систему улучшения речи нужно приспосабливать к новым шумам и корпусам, не храня старые данные и не разрушая уже освоенные навыки. Авторы замораживают общую модель и выделяют каждой области небольшой адаптер LoRA.
Метод. Базовая порождающая модель последовательно встречает DNS, EARS, LibriTTS-R и VoiceBank. Для каждой новой области обучается отдельный адаптер ранга 8 в блоках внимания и прямого распространения GPT-2. Если имя области неизвестно, адаптер выбирается по неопределённости модели; один адаптер содержит 1,18 млн параметров, около 1,1% основной сети.
Результаты. При известной области средний SpeechBertScore после четвёртого шага равен 0,88 против 0,83 у модели без адаптации, 0,73 у последовательной тонкой настройки и 0,83 у совместной настройки на всех доступных данных. На особенно отличающемся EARS система достигает DNSMOS OVL 3,31 и SBS 0,84 против 2,14 и 0,52 у GenSE.
Ограничения. Порядок областей фиксирован, а альтернативные последовательности не исследованы. В режиме без метки области качество заметно зависит от выбора адаптера: после четвёртого шага SBS падает с 0,88 до 0,76. Сравнение с GenSE ограничено EARS, поскольку остальные наборы пересекаются с его обучением.
Фишка из статьи. Обычная тонкая настройка не просто забывает старые шумы, но к концу становится хуже замороженной модели. Разделение адаптеров сохраняет общие знания и превосходит даже совместную настройку, которой разрешено видеть прежние данные.
| Способ | DNS | EARS | LibriTTS-R | VoiceBank |
|---|---|---|---|---|
| Без адаптации | 0,89 | 0,82 | 0,84 | 0,83 |
| Последовательная тонкая настройка | 0,85 | 0,78 | 0,74 | 0,73 |
| Совместная тонкая настройка | 0,85 | 0,80 | 0,82 | 0,83 |
| DIL-GenSE | 0,90 | 0,87 | 0,88 | 0,88 |
Как это читать: в столбцах указан средний SBS по текущей и уже пройденным областям. Разрыв 0,88 против 0,73 на последнем шаге показывает именно сохранение прежних навыков, а не локальный выигрыш на одном новом шуме.