KanAdapter: A Kolmogorov-Arnold Network-based Plug-and-Play Module for Efficient Fine-tuning of Foundation Speech Models
KanAdapter заменяет обычный узкий адаптер параллельным модулем на сети Колмогорова–Арнольда и дообучает лишь несколько процентов параметров речевой основы. Наиболее убедительный результат относится не к одной задаче, а к последовательному обучению: модуль заметно меньше забывает распознавание говорящего после адаптации к новым условиям.
Метод. Замороженные слои XLSR и других самонаблюдаемых основ получают параллельную ветвь GR-KAN с обучаемыми нелинейными одномерными функциями. Сравнение включает полное дообучение, LoRA и обычные адаптеры на распознавании говорящего, эмоций и поддельной речи. Размер узкого пространства меняется отдельно.
Результаты. На трёх тестах говорящих полное дообучение 364 млн параметров даёт EER 0,49/0,44/1,58%, KanAdapter с 9 млн — 0,52/0,50/1,93%; LoRA с 4 млн заметно хуже, 2,25/2,19/3,27%. В распознавании эмоций KanAdapter с 16 млн получает macro-F1 0,3290 против 0,3321 у полного обучения и 0,1822 у LoRA. Для поддельной речи преимущество менее устойчиво на внешних наборах.
Ограничения. Проверены классификационные задачи, но не распознавание или синтез последовательностей. На неглубоких основах разрыв с полным обучением больше, а объяснение поведения KAN остаётся эмпирическим. Число обучаемых параметров немного выше, чем у LoRA.
Фишка из статьи. После пяти последовательных адаптаций обычные малопараметрические методы забывают исходную задачу сильнее, чем KanAdapter.
| Метод после этапа ASV5 | EER тест 1, % | Тест 2, % | Тест 3, % | Тест 4, % |
|---|---|---|---|---|
| Полное дообучение | 5,25 | 4,74 | 6,92 | 8,60 |
| LoRA | 7,19 | 9,64 | 9,28 | 20,11 |
| Обычный адаптер | 4,94 | 4,24 | 3,38 | 11,11 |
| KanAdapter | 0,86 | 3,59 | 2,76 | 6,75 |
Как это читать: преимущество KAN наиболее велико именно после цепочки задач, а не в одиночном дообучении. Это указывает на сохранение старых границ решений, хотя внутренний механизм авторы пока не доказывают.