Adversarial contrastive learning для cross-domain incremental audio classification
Эта работа смотрит на менее удобный вариант incremental audio classification: новые классы приходят не только с малым числом примеров, но и из другого домена. Для речевых и аудио-систем это близко к реальному сценарию, где базовая модель обучалась на одном типе акустики, а затем получает новые события, устройства записи или окружения. Главная идея — не дообучать encoder в каждой новой сессии, а заранее сделать его более доменно-устойчивым через adversarial spectral perturbation и supervised contrastive learning.
Метод. В base session обучается audio encoder, после чего в incremental sessions он замораживается, а classifier расширяется новыми классами. Во время base training авторы добавляют adversarial training: спектральное возмущение генерирует target-domain-like samples в maximization step, а minimization step обучает модель на cross-entropy и supervised contrastive loss. В отличие от обычного few-shot class-incremental learning, здесь модель явно готовят к тому, что будущие классы будут жить в другом акустическом распределении.
Результаты. Оценка идет на шести cross-domain направлениях между FSC-89, NSynth-100 и LS-100. Предложенный метод получает average accuracy 46.89% на FS→NS, 41.67% на FS→LS, 85.17% на NS→FS, 79.09% на NS→LS, 80.05% на LS→FS и 79.78% на LS→NS. Для сравнения, сильные варианты AMFO дают 45.31/37.05/83.86/76.93/78.10/71.92, а AMFO+AFA — 44.75/41.52/84.46/78.50/79.47/78.68 на тех же направлениях.
Ограничения. Работа остается в рамках general audio classification, а не конкретной speech task; перенос на keyword spotting, speaker events или acoustic scene monitoring нужно проверять отдельно. Cross-domain setup собран из трех датасетов, поэтому он полезен как стресс-тест, но не покрывает всю сложность реальных микрофонов, room acoustics и шумов. Encoder после base session заморожен: это снижает catastrophic forgetting, но ограничивает адаптацию к сильно отличающимся будущим доменам.
Фишка из статьи. Хороший блок — абляция на направлении NS→LS. Она показывает, что основной выигрыш не возникает от одного трюка: supervised contrastive loss и adversarial training дают разные части эффекта, а вместе поднимают average accuracy на 3.63 пункта относительно обычного обучения.
| Supervised contrastive | Adversarial training | Average accuracy, NS→LS | Что видно |
|---|---|---|---|
| нет | нет | 75.46% | обычный base training хуже переносится |
| да | нет | 76.50% | contrastive loss дает +1.04 пункта |
| нет | да | 77.84% | spectral adversarial perturbation дает больший одиночный вклад |
| да | да | 79.09% | совместное обучение дает лучший результат |
Как это читать: результат интересен не тем, что метод в среднем выше baseline, а тем, что ablation отделяет два источника устойчивости. Contrastive loss стягивает классы в embedding space, adversarial perturbation тренирует переносимость к спектральному сдвигу, и только вместе они заметно улучшают class-incremental поведение.