DCASE heterogeneous audio classification: CLAP плюс acoustic branches и hierarchy-aware heads
Эта technical report полезна как инженерный разбор DCASE 2026 Task 1: heterogeneous audio classification по Broad Sound Taxonomy, где нужно не только угадать second-level class, но и сохранять иерархическую согласованность. Авторы строят систему поверх CLAP audio-text representations и добавляют feature-specific acoustic branches, hierarchy-aware classifiers и KNN post-processing.
Метод. Audio encoder CLAP дает high-level semantic representation, а отдельные acoustic branches добавляют log-Mel, MFCC или log-STFT признаки. На текстовой стороне используется Highway Gate Adapter для task-specific адаптации label embeddings. Финальный classifier сравнивается в нескольких вариантах: flat head, graph convolution, local classifier layer и ensemble. Post-log-STFT вариант использует KNN-based refinement как post-processing.
Результаты. Базовая CLAP-система дает Hierarchical F1 78.45% и Hierarchical Accuracy 79.58%. Добавление BSD-Grand поднимает F1 до 79.64, log-STFT branch — до 80.54, а KNN post-processing с log-STFT — до 80.84 и accuracy 81.39. По classifier heads Flat дает 80.57/81.53, LCL — 80.20/81.18, GC — 80.01/81.02. Лучший submitted ensemble System 3 достигает Hier. F1 81.25 и Hier. Accuracy 81.86.
Ограничения. Это challenge report: выводы оптимизированы под BSD10k-v1.2 protocol и BST hierarchy. Система не про speech-specific recognition, а про broad audio taxonomy, поэтому перенос на ASR, diarization или paralinguistic tasks косвенный. Улучшения умеренные — около 2.8 F1 points от baseline до лучшего ensemble — и зависят от dataset expansion и post-processing.
Фишка из статьи. Самый практичный результат — log-STFT оказывается лучшей single acoustic branch, а KD-log-STFT не превосходит простой post-processing.
| Config | Hier. F1 | Hier. Accuracy | Что меняется |
|---|---|---|---|
| Baseline | 78.45 | 79.58 | CLAP baseline |
| + BSD-Grand | 79.64 | 80.61 | расширение данных |
| + log-Mel | 79.95 | 80.63 | ручная acoustic branch |
| + MFCC | 80.13 | 80.39 | cepstral branch |
| + log-STFT | 80.54 | 81.12 | лучший raw acoustic branch |
| + Post-log-STFT | 80.84 | 81.39 | KNN refinement |
| System 3 ensemble | 81.25 | 81.86 | лучший ensemble |
Как это читать: CLAP уже несет сильную semantic audio-text информацию, но низкоуровневые spectral признаки все еще добавляют сигнал для taxonomy-consistent classification. Наиболее выгодный single-model upgrade здесь не самый сложный head, а log-STFT branch плюс аккуратное KNN refinement.