LoRA-геометрия в детекции поддельной речи: что меняет meta-learning
Эта работа не предлагает новый детектор поддельной речи; ее ценность в другом. Авторы берут уже известный факт, что MLDG-LoRA лучше переносится между доменами, чем обычное ERM-обучение, и спрашивают: чем именно отличаются обученные адаптеры при одинаковой архитектуре, rank, данных и seed? Ответ они ищут через эмпирический Fisher и эффективный ранг LoRA-обновлений.
Эксперимент построен аккуратно: frozen Wav2Vec 2.0 + AASIST, LoRA rank 16 в 24-слойном backbone, два режима обучения - pooled ERM и first-order MLDG. После обучения авторы не меняют модель, а измеряют диагональный эмпирический Fisher по LoRA-параметрам на шести корпусах: ASVspoof 2019 LA Eval, ASVspoof 2021 LA/DF, ASVspoof 5, In-The-Wild и FakeAVCeleb. Основная метрика RankMEF показывает, насколько loss-relevant энергия распределена по направлениям адаптера.
Главный результат: MLDG не просто «делает адаптер лучше», а перераспределяет его геометрию. В среднем по 5 seed, 6 корпусам и 24 слоям query projection снижает Fisher-weighted effective rank на 19.4%, key - на 19.3%, а output projection повышает его на 29.4%. По глубине эффект усиливается: для верхних слоев q падает на 33.0%, k - на 30.8%, а output в нижних слоях растет на 42.2%. На In-The-Wild локальная чувствительность ERM-адаптера к perturbation при epsilon=0.01 дает variance 0.56, у MLDG - 0.11, то есть ERM в 5.1 раза чувствительнее.
Ограничение в том, что это описательная, а не причинная работа. Она показывает устойчивый отпечаток MLDG в уже обученных адаптерах, но не доказывает, что именно такое перераспределение ранга вызывает выигрыш по ошибке. Диагональный Fisher - приближение, а анализ завязан на одну семейство архитектур и готовые чекпойнты. Тем не менее для инженера это полезный способ смотреть на LoRA не только как на набор параметров, а как на распределение чувствительности по модулям.
Фишка из статьи. Самый интересный вывод - MLDG одновременно сжимает attention-routing в q/k и распределяет content/output-обновления, причем этот рисунок повторяется на всех шести корпусах.
| Модуль | ERM RankMEF | MLDG RankMEF | Изменение | Согласие seed |
|---|---|---|---|---|
| q_proj | 3174 | 2559 | -19.4% | 5/5 |
| k_proj | 2912 | 2350 | -19.3% | 5/5 |
| v_proj | 3768 | 4015 | +6.6% | 3/5 |
| out_proj | 3787 | 4901 | +29.4% | 5/5 |
Как это читать: MLDG не увеличивает общий бюджет адаптера, а меняет, куда он тратится. Query/key становятся более компактными в loss-sensitive направлениях, а output-проекция шире распределяет обновление; это похоже на механизм, который делает решение менее привязанным к специфике одного синтетического домена.