Аудиокодировщики Частота Gabor
Частотно-временной анализ

Частотно-временные узкие места в сквозных аудиокодировщиках

31-35% collapse

Эта работа прямо попадает в тему частотно-временного анализа: авторы спрашивают, сохраняют ли современные сквозные аудиокодировщики доступ к интерпретируемым частотным примитивам вроде компонентов высоты и тембра. Сильная генерация или сжатие еще не доказывают, что эти признаки представлены в удобном базисе. Статья показывает два архитектурных узких места strided convolutional encoders: схлопывание частотных компонентов в alias-классы и плохую разделимость соседних частот learned filters.

Метод. Анализируются EnCodec, DAC и Stable Audio. Для injectivity авторы аналитически предсказывают, какие частотные компоненты будут неразличимы после каскада strides, и сверяют это с наблюдаемым collapse rate на 643 конфигурациях сигналов. Для separability они измеряют частотные полосы фильтров последнего сверточного слоя и сравнивают их с теоретическим пределом по receptive field. Затем предлагают Gabor Latent Refactorization: постобработку латентного пространства фиксированным частотно-локализованным базисом без полного переобучения модели.

Результаты. Предсказанные и наблюдаемые collapse rates почти совпадают: корреляция около 0.99 для всех трех моделей. Наблюдаемый collapse rate составляет 0.349 для EnCodec, 0.312 для DAC и 0.320 для Stable Audio. Фильтры оказываются намного шире теоретического предела: best bandwidth в 10x, 35x и 31x выше receptive-field bound для EnCodec, DAC и Stable Audio соответственно. После Gabor refactorization минимальные полосы снижаются до 1.62x, 2.21x и 1.48x от предела при latent cosine 0.97-0.98.

Ограничения. Это controlled analysis, а не полный benchmark качества речи или музыки. Выводы сильнее всего относятся к strided convolutional encoders и к частотным примитивам; другие архитектуры или более сложные тембральные признаки могут вести себя иначе. Gabor refactorization улучшает управляемость и интерпретируемость, но не доказывает автоматический выигрыш во всех downstream-задачах.

Фишка из статьи. Самая наглядная инженерная деталь - локализация pitch substitution. В исходном латентном пространстве изменение E -> F# размазано по сотням каналов, а в Gabor-базисе концентрируется в нескольких частотных bins.

МодельCollapse QBest BW / RF доMin BW / RF послеLatent cosine после
EnCodec0.34910x1.62x0.98
DAC0.31235x2.21x0.98
Stable Audio0.32031x1.48x0.97
Пример E -> F#-80% delta в 349 latent channels80% delta в 3 Gabor bins-

Как это читать: модель может хорошо восстанавливать звук, но держать высоту и тембр в неудобной, размазанной системе координат. Gabor-базис не добавляет магии, а возвращает частотную локальность, которую обычная архитектура частично потеряла.

Оригинальная статья на arXiv