DINO-A: отрицательный результат для самодистилляции аудио
DINO-A проверяет простой, но важный вопрос: можно ли перенести успешную самодистилляцию из компьютерного зрения на аудиоспектрограммы почти без изменения идеи. Авторы адаптируют DINO к обучению аудиопредставлений без меток и честно показывают, что на выбранном масштабе метод уступает специализированному BYOL-A. Поэтому статья интересна как аккуратный отрицательный результат, а не как очередное обещание универсального self-supervised рецепта.
Метод. Предобучение идет на FSD50K без меток, затем замороженный кодировщик оценивается через EVAR linear probing на ESC-50, Speech Commands v2, UrbanSound8K и GTZAN. Сравниваются ViT с патчами 8x8 и 16x16, а также сверточная версия. Отличие от зрительного DINO в том, что глобальные и локальные crop на спектрограмме хуже соответствуют семантике события: короткий аудиофрагмент может либо содержать событие целиком, либо вообще не содержать нужной информации.
Результаты. Лучший DINO-A ViT 8x8 дает среднюю accuracy 70.07 по четырем наборам, ViT 16x16 - 69.37, CNN - 65.03. BYOL-A v2 получает 82.03, то есть опережает лучший DINO-A на 11.96 процентного пункта. Разрыв особенно велик на GTZAN: 73.44 у BYOL-A против 48.66 у DINO-A ViT 8x8. При этом на Speech Commands CNN-DINO-A дает 88.56 и обходит ViT-варианты, что намекает на пользу локальных сверточных bias для коротких речевых команд.
Ограничения. Масштаб предобучения ограничен FSD50K, поэтому нельзя утверждать, что DINO принципиально плохо подходит аудио. Оценка только через linear probing, без end-to-end дообучения и без больших аудиокорпусов. Нет прямого scaling-исследования, которое отделило бы недостаток метода от недостатка данных.
Фишка из статьи. Фишка статьи - не победа новой модели, а диагностика: более мелкие частотно-временные патчи помогают, но не закрывают главный разрыв.
| Модель | Средняя accuracy | Наблюдение |
|---|---|---|
| DINO-A ViT 16x16 | 69.37 | крупнее патчи, меньше временно-частотных токенов |
| DINO-A ViT 8x8 | 70.07 | 96 токенов, чуть лучше детализация |
| DINO-A CNN | 65.03 | хуже в среднем, но 88.56 на Speech Commands |
| BYOL-A v2 | 82.03 | специализированный аудио-baseline сильно впереди |
Как это читать: механика из зрения не переносится автоматически: частотно-временная структура аудио требует других crop, инвариантностей и, возможно, большего масштаба данных. Это полезное предупреждение для SSL в речи и аудио.