LoRA Meta-learning Fisher
Детекция поддельной речи

LoRA-геометрия в детекции поддельной речи: что меняет meta-learning

RankMEF

Эта работа не предлагает новый детектор поддельной речи; ее ценность в другом. Авторы берут уже известный факт, что MLDG-LoRA лучше переносится между доменами, чем обычное ERM-обучение, и спрашивают: чем именно отличаются обученные адаптеры при одинаковой архитектуре, rank, данных и seed? Ответ они ищут через эмпирический Fisher и эффективный ранг LoRA-обновлений.

Эксперимент построен аккуратно: frozen Wav2Vec 2.0 + AASIST, LoRA rank 16 в 24-слойном backbone, два режима обучения - pooled ERM и first-order MLDG. После обучения авторы не меняют модель, а измеряют диагональный эмпирический Fisher по LoRA-параметрам на шести корпусах: ASVspoof 2019 LA Eval, ASVspoof 2021 LA/DF, ASVspoof 5, In-The-Wild и FakeAVCeleb. Основная метрика RankMEF показывает, насколько loss-relevant энергия распределена по направлениям адаптера.

Главный результат: MLDG не просто «делает адаптер лучше», а перераспределяет его геометрию. В среднем по 5 seed, 6 корпусам и 24 слоям query projection снижает Fisher-weighted effective rank на 19.4%, key - на 19.3%, а output projection повышает его на 29.4%. По глубине эффект усиливается: для верхних слоев q падает на 33.0%, k - на 30.8%, а output в нижних слоях растет на 42.2%. На In-The-Wild локальная чувствительность ERM-адаптера к perturbation при epsilon=0.01 дает variance 0.56, у MLDG - 0.11, то есть ERM в 5.1 раза чувствительнее.

Ограничение в том, что это описательная, а не причинная работа. Она показывает устойчивый отпечаток MLDG в уже обученных адаптерах, но не доказывает, что именно такое перераспределение ранга вызывает выигрыш по ошибке. Диагональный Fisher - приближение, а анализ завязан на одну семейство архитектур и готовые чекпойнты. Тем не менее для инженера это полезный способ смотреть на LoRA не только как на набор параметров, а как на распределение чувствительности по модулям.

Фишка из статьи. Самый интересный вывод - MLDG одновременно сжимает attention-routing в q/k и распределяет content/output-обновления, причем этот рисунок повторяется на всех шести корпусах.

МодульERM RankMEFMLDG RankMEFИзменениеСогласие seed
q_proj31742559-19.4%5/5
k_proj29122350-19.3%5/5
v_proj37684015+6.6%3/5
out_proj37874901+29.4%5/5

Как это читать: MLDG не увеличивает общий бюджет адаптера, а меняет, куда он тратится. Query/key становятся более компактными в loss-sensitive направлениях, а output-проекция шире распределяет обновление; это похоже на механизм, который делает решение менее привязанным к специфике одного синтетического домена.

Оригинальная статья на arXiv