дистилляция объединение моделей речь и музыка
arXiv cs.SD

Корреляционная дистилляция делает кодировщики речи и музыки лучше объединяемыми

arXiv:2610.02836

Работа спрашивает не только, насколько хорош сжатый кодировщик сам по себе, но и насколько безболезненно его можно объединить с кодировщиком другого домена. Замена обычной потери DistilHuBERT на корреляционную делает речевую и музыкальную модели структурно ближе и устойчивее как при интерполяции весов, так и при перестановке каналов.

Метод. Отдельные ученики дистиллируются от речевого и музыкального учителей при одинаковых архитектурах, начальных весах и числе шагов. Затем они объединяются двумя принципиально разными способами: task arithmetic интерполирует веса, а correlation permutation сначала сопоставляет каналы по активациям. Проверка включает четыре речевые и пять музыкально-звуковых задач.

Результаты. При интерполяции корреляционная потеря ближе к лучшему исходному ученику в 17 из 18 сравнений. Для трёхслойной модели при весе речи 0,8 среднее ухудшение на речевых задачах сокращается с −3,01 до −1,01 п.п., на музыкальных — с −4,51 до −0,59 п.п.; WER равен 13,62% против 17,08%. При перестановочном объединении средняя корреляция сопоставленных каналов растёт с 59,9% до 69,3%.

Ограничения. Проверены небольшие ученики, одна пара речевого и музыкального учителей и девять задач; неясно, сохраняется ли эффект на больших генеративных моделях. Корреляционные ученики сильнее ещё до объединения, поэтому не вся разница относится к совместимости. Музыкальные конечные точки местами уступают, вероятно из-за привязки к речевой инициализации.

Фишка из статьи. Структурная разница видна без какой-либо конечной задачи. В первом свёрточном слое корреляционным ученикам достаточно переставить 21,3% каналов вместо 42,0%, а в четвёртом и пятом — ни одного вместо 10,9–33,6%. То есть функция дистилляции формирует совместимую систему координат.

Точка объединения, 3 слояОбычная дистилляция: переставленоКорреляционная: переставлено
Свёртка 142,0%21,3%
Свёртки 4–510,9–33,6%0,0%
Блок 1, внимание / FFN99,0% / 98,2%94,4% / 78,3%
Блок 2, внимание / FFN99,9% / 99,3%99,0% / 89,8%
Средняя |корреляция| сопоставленных каналов59,9%69,3%

Как это читать: выигрыш сосредоточен в ранних общих признаках и первых FFN, а к третьему блоку обе пары почти полностью расходятся. Это объясняет, почему объединение улучшается, но не становится бесшовным.

Оригинальная статья на arXiv