Генерация аудио DiT VAE
Генерация аудио

Qwen-Audio-3.0-Gen-Preview: сцены как временные записи

mIoU 43.73

Qwen-Audio-3.0-Gen-Preview пытается объединить синтез речи, диалоги, звуковые события и длинные сцены в одном неавторегрессионном генераторе. Статья интересна не только моделью DiT, а интерфейсом условий: свободный запрос сначала превращается в структурированную временную запись с ролями, фоном, событиями и интервалами, а уже потом рендерится в текстовое условие. Это делает генерацию аудио ближе к монтажу сцены, где важно не просто наличие звуков, а их порядок, длительность и совместное звучание.

Метод. Система использует общий continuous VAE, который сжимает 48 kHz stereo waveform в 25 Hz latent sequence, и Diffusion Transformer, работающий в этом латентном пространстве. Prompt enhancement извлекает global scene, ambience, source profiles, time-sorted events и primary audible content; deterministic renderer превращает запись в стабильную grammar для модели. При обучении используются semantic conditional views: full, dialogue, scene и empty, чтобы classifier-free guidance видел разные части условия, не переписывая фактическую разметку.

Результаты. На Seed-TTS-Eval модель дает лучшую speaker similarity среди сравниваемых систем: SIM 0.805 для EN, 0.819 для ZH и 0.808 для Hard-ZH, но WER/CER не всегда лучшие: EN WER 1.61, ZH CER 1.06, Hard-ZH CER 8.25. На multi-speaker benchmark она лучше по cross-turn consistency: 0.702 для EN и 0.740 для ZH, хотя baseline Seed-Audio-1.0 имеет ниже EN WER и ZH CER. На AudioCaps модель лидирует по LALM-оценке Qwen3 на full set 0.8393 и по AudioBox PQ/PC/CE/CU 6.256/3.616/3.960/5.389, но не лидирует по CLAP.

Ограничения. Много ключевых проверок in-house, а часть метрик основана на больших audio-language judges, поэтому результаты зависят от качества судей и без доверительных интервалов читаются осторожно. Unified generation дает широкое покрытие, но по отдельным speech-метрикам может уступать специализированным системам. Также статья не закрывает вопросы latency, доступности модели, субъективного прослушивания и поведения на длинных сценах за пределами тестовой длительности.

Фишка из статьи. В rich-timeline тесте видно, что модель не просто «лучше генерирует звуки»: она жертвует полнотой событий ради более точной локализации во времени.

Judge и модельRecallmIoUIoU@0.3IoU@0.5
Gemini, Seed-Audio-1.098.77%38.48%56.17%38.27%
Gemini, Qwen-Audio-3.0-Gen-Preview88.58%43.73%66.36%50.00%
Qwen3.5, Seed-Audio-1.097.84%37.36%56.79%36.73%
Qwen3.5, Qwen-Audio-3.0-Gen-Preview87.35%43.12%65.74%43.83%

Как это читать: Seed-Audio чаще вставляет запрошенные события, но хуже попадает во временные интервалы. Qwen-Audio теряет около 10 пунктов recall, зато выигрывает по mIoU и обоим IoU thresholds, что соответствует цели структурированного timeline control.

Оригинальная статья на arXiv