Частотно-временные узкие места в сквозных аудиокодировщиках
Эта работа прямо попадает в тему частотно-временного анализа: авторы спрашивают, сохраняют ли современные сквозные аудиокодировщики доступ к интерпретируемым частотным примитивам вроде компонентов высоты и тембра. Сильная генерация или сжатие еще не доказывают, что эти признаки представлены в удобном базисе. Статья показывает два архитектурных узких места strided convolutional encoders: схлопывание частотных компонентов в alias-классы и плохую разделимость соседних частот learned filters.
Метод. Анализируются EnCodec, DAC и Stable Audio. Для injectivity авторы аналитически предсказывают, какие частотные компоненты будут неразличимы после каскада strides, и сверяют это с наблюдаемым collapse rate на 643 конфигурациях сигналов. Для separability они измеряют частотные полосы фильтров последнего сверточного слоя и сравнивают их с теоретическим пределом по receptive field. Затем предлагают Gabor Latent Refactorization: постобработку латентного пространства фиксированным частотно-локализованным базисом без полного переобучения модели.
Результаты. Предсказанные и наблюдаемые collapse rates почти совпадают: корреляция около 0.99 для всех трех моделей. Наблюдаемый collapse rate составляет 0.349 для EnCodec, 0.312 для DAC и 0.320 для Stable Audio. Фильтры оказываются намного шире теоретического предела: best bandwidth в 10x, 35x и 31x выше receptive-field bound для EnCodec, DAC и Stable Audio соответственно. После Gabor refactorization минимальные полосы снижаются до 1.62x, 2.21x и 1.48x от предела при latent cosine 0.97-0.98.
Ограничения. Это controlled analysis, а не полный benchmark качества речи или музыки. Выводы сильнее всего относятся к strided convolutional encoders и к частотным примитивам; другие архитектуры или более сложные тембральные признаки могут вести себя иначе. Gabor refactorization улучшает управляемость и интерпретируемость, но не доказывает автоматический выигрыш во всех downstream-задачах.
Фишка из статьи. Самая наглядная инженерная деталь - локализация pitch substitution. В исходном латентном пространстве изменение E -> F# размазано по сотням каналов, а в Gabor-базисе концентрируется в нескольких частотных bins.
| Модель | Collapse Q | Best BW / RF до | Min BW / RF после | Latent cosine после |
|---|---|---|---|---|
| EnCodec | 0.349 | 10x | 1.62x | 0.98 |
| DAC | 0.312 | 35x | 2.21x | 0.98 |
| Stable Audio | 0.320 | 31x | 1.48x | 0.97 |
| Пример E -> F# | - | 80% delta в 349 latent channels | 80% delta в 3 Gabor bins | - |
Как это читать: модель может хорошо восстанавливать звук, но держать высоту и тембр в неудобной, размазанной системе координат. Gabor-базис не добавляет магии, а возвращает частотную локальность, которую обычная архитектура частично потеряла.