Audio SSL Представления Абляция
arXiv cs.SD

DINO-A: отрицательный результат для самодистилляции аудио

arXiv:2608.10659

DINO-A проверяет простой, но важный вопрос: можно ли перенести успешную самодистилляцию из компьютерного зрения на аудиоспектрограммы почти без изменения идеи. Авторы адаптируют DINO к обучению аудиопредставлений без меток и честно показывают, что на выбранном масштабе метод уступает специализированному BYOL-A. Поэтому статья интересна как аккуратный отрицательный результат, а не как очередное обещание универсального self-supervised рецепта.

Метод. Предобучение идет на FSD50K без меток, затем замороженный кодировщик оценивается через EVAR linear probing на ESC-50, Speech Commands v2, UrbanSound8K и GTZAN. Сравниваются ViT с патчами 8x8 и 16x16, а также сверточная версия. Отличие от зрительного DINO в том, что глобальные и локальные crop на спектрограмме хуже соответствуют семантике события: короткий аудиофрагмент может либо содержать событие целиком, либо вообще не содержать нужной информации.

Результаты. Лучший DINO-A ViT 8x8 дает среднюю accuracy 70.07 по четырем наборам, ViT 16x16 - 69.37, CNN - 65.03. BYOL-A v2 получает 82.03, то есть опережает лучший DINO-A на 11.96 процентного пункта. Разрыв особенно велик на GTZAN: 73.44 у BYOL-A против 48.66 у DINO-A ViT 8x8. При этом на Speech Commands CNN-DINO-A дает 88.56 и обходит ViT-варианты, что намекает на пользу локальных сверточных bias для коротких речевых команд.

Ограничения. Масштаб предобучения ограничен FSD50K, поэтому нельзя утверждать, что DINO принципиально плохо подходит аудио. Оценка только через linear probing, без end-to-end дообучения и без больших аудиокорпусов. Нет прямого scaling-исследования, которое отделило бы недостаток метода от недостатка данных.

Фишка из статьи. Фишка статьи - не победа новой модели, а диагностика: более мелкие частотно-временные патчи помогают, но не закрывают главный разрыв.

МодельСредняя accuracyНаблюдение
DINO-A ViT 16x1669.37крупнее патчи, меньше временно-частотных токенов
DINO-A ViT 8x870.0796 токенов, чуть лучше детализация
DINO-A CNN65.03хуже в среднем, но 88.56 на Speech Commands
BYOL-A v282.03специализированный аудио-baseline сильно впереди

Как это читать: механика из зрения не переносится автоматически: частотно-временная структура аудио требует других crop, инвариантностей и, возможно, большего масштаба данных. Это полезное предупреждение для SSL в речи и аудио.

Оригинальная статья на arXiv