Attention-fused prototypes для few-shot open-set audio classification
Статья разбирает задачу few-shot open-set audio classification: системе дают несколько примеров новых классов, но на тесте она должна не только распознать эти классы, а еще и отвергнуть неизвестные звуки. Это полезно для речевых и аудио-систем, где набор событий быстро меняется, а ложное присваивание неизвестного сигнала известному классу часто опаснее, чем обычная ошибка классификации. Главный ход авторов — строить прототипы не как простое среднее support-примеров, а как attention-fused представления, учитывающие связь support и query.
Метод. Модель использует ResNet-encoder и несколько генераторов прототипов. Для базовых классов прототипы обучаются на большом наборе размеченных примеров; для few-shot классов PGFC объединяет support и query embeddings через модуль fusion, преобразование support embedding и attention aggregation. Отдельный PGOC строит прототип open-set класса из base- и few-shot-прототипов, чтобы неизвестные примеры имели собственную область решения, а не насильно распределялись между known classes.
Результаты. На LS-100 метод получает 85.98% accuracy / 90.55% AUROC в 5-way 1-shot и 95.25% / 92.38% в 5-way 5-shot. На NSynth-100 результаты составляют 88.05% / 85.67% и 94.30% / 91.26%; на более шумном FSC-89 — 63.62% / 71.24% и 80.83% / 82.06%. Accuracy показывает точность классификации известных few-shot классов вместе с open-set решением, а AUROC показывает, насколько устойчиво модель отделяет неизвестные примеры от известных.
Ограничения. Это не специализированная speech paper: проверка идет на наборах общих аудио-событий и музыкальных инструментов, поэтому перенос на ASR front-end, KWS или paralinguistic detection требует отдельной проверки. Конструкция прототипов использует информацию query-эпизода, что хорошо для episodic evaluation, но может быть менее удобно в streaming inference. На FSC-89 падение до 63.62% в 1-shot показывает, что метод заметно чувствителен к акустической неоднородности и качеству few-shot support.
Фишка из статьи. Самая полезная инженерная деталь — не только выигрыш в AUROC, а соотношение качества и вычислительной цены. AIFP оказывается близок к легким baselines по inference time, но сохраняет сильные open-set результаты; при этом некоторые attention-heavy альтернативы стоят на порядок дороже по MACs.
| Метод | MACs, млн | AIT, с | Параметры, млн | Комментарий |
|---|---|---|---|---|
| OpenFEAT | 28213 | 6.63 | 11.34 | тяжелая attention baseline |
| TANE | 30102 | 7.14 | 15.86 | самая дорогая из сравниваемых |
| FEAT | 7241 | 4.41 | 12.38 | средняя вычислительная цена |
| L3-Net | 1973 | 3.24 | 11.33 | чуть быстрее, но слабее по open-set качеству |
| AIFP / Ours | 2259 | 3.37 | 15.02 | 95.25% Acc и 92.38% AUROC на LS-100 5-shot |
Как это читать: статья интересна не как очередная episodic-classification архитектура, а как попытка удержать open-set detection в разумном вычислительном бюджете. AIFP не минимален по числу параметров, но по MACs и времени ближе к легким моделям, чем к тяжелым attention baselines, при этом лучше отделяет unknown audio.