Qwen-Audio-VAE: быстрый 12.5 Hz латент для генерации аудио
Qwen-Audio-VAE - технический отчет про непрерывный аудиоавтоэнкодер, который оптимизируется не только под качество восстановления, но и под стоимость обучения генераторов аудио. Главный ход - очень короткий латентный ряд 12.5 Hz при 128 измерениях и быстрый энкодер: 30-секундная запись превращается примерно в 375 латентных кадров. Для генерации это важно напрямую, потому что длина латента определяет стоимость последующей diffusion/flow-модели.
Метод. Модель работает с 24 kHz mono audio и строит диагонально-гауссов латент. Сверточный causal-энкодер сначала снижает частоту до 50 Hz, затем bottleneck дает 12.5 Hz; два window Transformer блока работают уже на низкой частоте, чтобы не платить за внимание на длинной последовательности. Декодер специально сделан тяжелее энкодера, потому что массовая offline-выгрузка латентов упирается именно в энкодер. Обучение идет на 5 млн часов аудио: около 3 млн часов речи, 1.3 млн музыки и 0.8 млн шумов/звуковых сцен, с multi-resolution STFT, mel-loss, adversarial и feature-matching loss.
Результаты. На LibriSpeech среди low-frame-rate моделей Qwen-Audio-VAE получает Mel 0.513, MR-STFT 0.715, PESQ 3.975 и STOI 0.980 при 12.5 Hz; Stable Audio Open при 20 Hz имеет PESQ 2.722 и STOI 0.930. На AudioCaps модель также лучшая в low-frame-rate группе по Mel, PESQ и STOI: 0.649, 2.952, 0.812. На SongDescriber она обходит Stable Audio Open по всем четырем метрикам, включая PESQ 3.319 против 2.617. В downstream text-to-audio быстрый энкодер позволяет увеличить batch с 16 до 64 и поднять AudioCaps CLAP с 0.29 до 0.33 при тех же 36 часах обучения.
Ограничения. Это не универсальный речевой кодек для связи, а представление для генерации аудио; субъективные listening-тесты в отчете не являются центральной частью проверки. Модель обучалась на 32 A100 80G и 5 млн часов аудио, так что рецепт дорогой. Высокочастотные детали и транзиенты прямо названы направлением будущей работы, а сильная KL-регуляризация ухудшает генерацию, значит латент пока не является «идеально нормальным» пространством для любого генератора.
Фишка из статьи. Самая полезная инженерная деталь - ускорение энкодера. Авторы не просто уменьшили модель: они показывают, что наивное сокращение всех каналов разрушает восстановление, поэтому режут только высокочастотный по времени первый слой и оставляют емкость в поздних слоях.
| Вариант энкодера | Задержка для 64×30 s | Ускорение |
|---|---|---|
| До ускорения | 1957 ms | 1.00× |
| Перераспределение strides | 1361 ms | 1.44× |
| Pruning residual units | 747 ms | 2.62× |
| Снижение каналов первого слоя | 541 ms | 3.62× |
Как это читать: 64 клипа по 30 секунд - это 32 минуты аудио, закодированные за 541 ms. При этом наивное уменьшение всех каналов роняло PESQ wb/nb с 3.09/3.44 до 1.91/2.37 и SI-SDR с 8.34 до -2.80, поэтому выигрыш здесь именно в профилировании узкого места, а не в простом «сделать меньше».