KVAE-Audio: 48 кГц токенизатор для аудиодиффузии
KVAE - семейство токенизаторов для генеративных моделей, а для аудио особенно интересен вариант KVAE-Audio: непрерывный токенизатор полного диапазона 48 кГц с частотой скрытых кадров 50 Гц. Статья не только сравнивает реконструкцию, но и делает более важный тест: подставляет разные токенизаторы в одну аудиодиффузионную модель. Поэтому ее полезно читать как работу о том, какие скрытые представления действительно удобны для генерации, а не только для сжатия.
Метод. KVAE-Audio кодирует звук в 64-канальное непрерывное скрытое представление с частотой 50 Гц и имеет 166.9 млн параметров. Авторы сравнивают его с MMAudio, DACVAE и SAME-L на общем аудио, музыке и речи. Затем токенизаторы подставляются в генератор, чтобы проверить не только обратимость кодека, но и то, насколько хорошо диффузионная модель учится в этом пространстве.
Результаты. На речи KVAE-Audio получает PESQ 4.266, что чуть выше DACVAE с 4.246 и заметно выше SAME-L с 2.982 и MMAudio с 2.424. В генерации речи с тем же генератором KVAE-Audio дает WER 0.244 и CER 0.576, лучше MMAudio с 0.257/0.593, DACVAE с 0.911/1.048 и SAME-L с 0.349/0.629. На музыке KVAE-Audio также силен по SDR 10.675 и SNR 10.677, хотя преимущество зависит от метрики.
Ограничения. Это не узкоспециализированный речевой кодек и не система потокового распознавания; модель крупная, а оценка генерации зависит от выбранного диффузионного генератора. Автоматические метрики для аудио, особенно FAD и родственные расстояния, имеют ограничения на широкополосном звуке. Кроме того, непрерывные токены удобны для диффузии, но не обязательно подходят для дискретных языковых моделей речи.
Фишка из статьи. Важный тест - не реконструкция сама по себе, а замена токенизатора в генераторе. DACVAE почти не уступает по восстановлению речи, но при генерации речь резко разваливается по WER; значит, хороший автоэнкодер не обязательно дает удобное пространство для генеративной модели.
| Токенизатор в генераторе речи | CLAP выше лучше | FAD PANNs ниже лучше | WER ниже лучше | CER ниже лучше |
|---|---|---|---|---|
| MMAudio | 0.368 | 8.305 | 0.257 | 0.593 |
| DACVAE | 0.413 | 5.008 | 0.911 | 1.048 |
| SAME-L | 0.379 | 10.257 | 0.349 | 0.629 |
| KVAE-Audio | 0.389 | 4.677 | 0.244 | 0.576 |
Как это читать: WER и CER здесь оценивают понятность сгенерированной речи после смены токенизатора. DACVAE имеет сильный CLAP и неплохой FAD, но высокий WER показывает, что речевая структура в его скрытом пространстве хуже подходит конкретному генератору; KVAE-Audio дает более пригодный компромисс.