Incremental Domain shift Audio
Audio classification

Adversarial contrastive learning для cross-domain incremental audio classification

AA 85.17%

Эта работа смотрит на менее удобный вариант incremental audio classification: новые классы приходят не только с малым числом примеров, но и из другого домена. Для речевых и аудио-систем это близко к реальному сценарию, где базовая модель обучалась на одном типе акустики, а затем получает новые события, устройства записи или окружения. Главная идея — не дообучать encoder в каждой новой сессии, а заранее сделать его более доменно-устойчивым через adversarial spectral perturbation и supervised contrastive learning.

Метод. В base session обучается audio encoder, после чего в incremental sessions он замораживается, а classifier расширяется новыми классами. Во время base training авторы добавляют adversarial training: спектральное возмущение генерирует target-domain-like samples в maximization step, а minimization step обучает модель на cross-entropy и supervised contrastive loss. В отличие от обычного few-shot class-incremental learning, здесь модель явно готовят к тому, что будущие классы будут жить в другом акустическом распределении.

Результаты. Оценка идет на шести cross-domain направлениях между FSC-89, NSynth-100 и LS-100. Предложенный метод получает average accuracy 46.89% на FS→NS, 41.67% на FS→LS, 85.17% на NS→FS, 79.09% на NS→LS, 80.05% на LS→FS и 79.78% на LS→NS. Для сравнения, сильные варианты AMFO дают 45.31/37.05/83.86/76.93/78.10/71.92, а AMFO+AFA — 44.75/41.52/84.46/78.50/79.47/78.68 на тех же направлениях.

Ограничения. Работа остается в рамках general audio classification, а не конкретной speech task; перенос на keyword spotting, speaker events или acoustic scene monitoring нужно проверять отдельно. Cross-domain setup собран из трех датасетов, поэтому он полезен как стресс-тест, но не покрывает всю сложность реальных микрофонов, room acoustics и шумов. Encoder после base session заморожен: это снижает catastrophic forgetting, но ограничивает адаптацию к сильно отличающимся будущим доменам.

Фишка из статьи. Хороший блок — абляция на направлении NS→LS. Она показывает, что основной выигрыш не возникает от одного трюка: supervised contrastive loss и adversarial training дают разные части эффекта, а вместе поднимают average accuracy на 3.63 пункта относительно обычного обучения.

Supervised contrastiveAdversarial trainingAverage accuracy, NS→LSЧто видно
нетнет75.46%обычный base training хуже переносится
данет76.50%contrastive loss дает +1.04 пункта
нетда77.84%spectral adversarial perturbation дает больший одиночный вклад
дада79.09%совместное обучение дает лучший результат

Как это читать: результат интересен не тем, что метод в среднем выше baseline, а тем, что ablation отделяет два источника устойчивости. Contrastive loss стягивает классы в embedding space, adversarial perturbation тренирует переносимость к спектральному сдвигу, и только вместе они заметно улучшают class-incremental поведение.

Оригинальная статья на arXiv