Аудиотокены 48 кГц Diffusion
arXiv cs.LG

KVAE-Audio: 48 кГц токенизатор для аудиодиффузии

arXiv:2608.05798

KVAE - семейство токенизаторов для генеративных моделей, а для аудио особенно интересен вариант KVAE-Audio: непрерывный токенизатор полного диапазона 48 кГц с частотой скрытых кадров 50 Гц. Статья не только сравнивает реконструкцию, но и делает более важный тест: подставляет разные токенизаторы в одну аудиодиффузионную модель. Поэтому ее полезно читать как работу о том, какие скрытые представления действительно удобны для генерации, а не только для сжатия.

Метод. KVAE-Audio кодирует звук в 64-канальное непрерывное скрытое представление с частотой 50 Гц и имеет 166.9 млн параметров. Авторы сравнивают его с MMAudio, DACVAE и SAME-L на общем аудио, музыке и речи. Затем токенизаторы подставляются в генератор, чтобы проверить не только обратимость кодека, но и то, насколько хорошо диффузионная модель учится в этом пространстве.

Результаты. На речи KVAE-Audio получает PESQ 4.266, что чуть выше DACVAE с 4.246 и заметно выше SAME-L с 2.982 и MMAudio с 2.424. В генерации речи с тем же генератором KVAE-Audio дает WER 0.244 и CER 0.576, лучше MMAudio с 0.257/0.593, DACVAE с 0.911/1.048 и SAME-L с 0.349/0.629. На музыке KVAE-Audio также силен по SDR 10.675 и SNR 10.677, хотя преимущество зависит от метрики.

Ограничения. Это не узкоспециализированный речевой кодек и не система потокового распознавания; модель крупная, а оценка генерации зависит от выбранного диффузионного генератора. Автоматические метрики для аудио, особенно FAD и родственные расстояния, имеют ограничения на широкополосном звуке. Кроме того, непрерывные токены удобны для диффузии, но не обязательно подходят для дискретных языковых моделей речи.

Фишка из статьи. Важный тест - не реконструкция сама по себе, а замена токенизатора в генераторе. DACVAE почти не уступает по восстановлению речи, но при генерации речь резко разваливается по WER; значит, хороший автоэнкодер не обязательно дает удобное пространство для генеративной модели.

Токенизатор в генераторе речиCLAP выше лучшеFAD PANNs ниже лучшеWER ниже лучшеCER ниже лучше
MMAudio0.3688.3050.2570.593
DACVAE0.4135.0080.9111.048
SAME-L0.37910.2570.3490.629
KVAE-Audio0.3894.6770.2440.576

Как это читать: WER и CER здесь оценивают понятность сгенерированной речи после смены токенизатора. DACVAE имеет сильный CLAP и неплохой FAD, но высокий WER показывает, что речевая структура в его скрытом пространстве хуже подходит конкретному генератору; KVAE-Audio дает более пригодный компромисс.

Оригинальная статья на arXiv