DCASE CLAP Hierarchical F1
Audio classification

DCASE heterogeneous audio classification: CLAP плюс acoustic branches и hierarchy-aware heads

HierF1 81.25

Эта technical report полезна как инженерный разбор DCASE 2026 Task 1: heterogeneous audio classification по Broad Sound Taxonomy, где нужно не только угадать second-level class, но и сохранять иерархическую согласованность. Авторы строят систему поверх CLAP audio-text representations и добавляют feature-specific acoustic branches, hierarchy-aware classifiers и KNN post-processing.

Метод. Audio encoder CLAP дает high-level semantic representation, а отдельные acoustic branches добавляют log-Mel, MFCC или log-STFT признаки. На текстовой стороне используется Highway Gate Adapter для task-specific адаптации label embeddings. Финальный classifier сравнивается в нескольких вариантах: flat head, graph convolution, local classifier layer и ensemble. Post-log-STFT вариант использует KNN-based refinement как post-processing.

Результаты. Базовая CLAP-система дает Hierarchical F1 78.45% и Hierarchical Accuracy 79.58%. Добавление BSD-Grand поднимает F1 до 79.64, log-STFT branch — до 80.54, а KNN post-processing с log-STFT — до 80.84 и accuracy 81.39. По classifier heads Flat дает 80.57/81.53, LCL — 80.20/81.18, GC — 80.01/81.02. Лучший submitted ensemble System 3 достигает Hier. F1 81.25 и Hier. Accuracy 81.86.

Ограничения. Это challenge report: выводы оптимизированы под BSD10k-v1.2 protocol и BST hierarchy. Система не про speech-specific recognition, а про broad audio taxonomy, поэтому перенос на ASR, diarization или paralinguistic tasks косвенный. Улучшения умеренные — около 2.8 F1 points от baseline до лучшего ensemble — и зависят от dataset expansion и post-processing.

Фишка из статьи. Самый практичный результат — log-STFT оказывается лучшей single acoustic branch, а KD-log-STFT не превосходит простой post-processing.

ConfigHier. F1Hier. AccuracyЧто меняется
Baseline78.4579.58CLAP baseline
+ BSD-Grand79.6480.61расширение данных
+ log-Mel79.9580.63ручная acoustic branch
+ MFCC80.1380.39cepstral branch
+ log-STFT80.5481.12лучший raw acoustic branch
+ Post-log-STFT80.8481.39KNN refinement
System 3 ensemble81.2581.86лучший ensemble

Как это читать: CLAP уже несет сильную semantic audio-text информацию, но низкоуровневые spectral признаки все еще добавляют сигнал для taxonomy-consistent classification. Наиболее выгодный single-model upgrade здесь не самый сложный head, а log-STFT branch плюс аккуратное KNN refinement.

Оригинальная статья на arXiv