SVS Benchmark Genre
Singing voice synthesis

MMGenre: benchmark для genre-aware singing voice synthesis

GCS-5 4.9

MMGenre полезна как диагностическая работа для singing voice synthesis: современные SVS модели могут давать приемлемую naturalness, но это не значит, что они действительно управляют музыкальным жанром. Авторы строят benchmark на 10 major genres и 26 subgenres и показывают genre collapse: синтезированные вокалы из разных жанров становятся акустически слишком похожими. Главный вывод не в очередном росте MOS, а в том, что zero-shot genre conditioning почти не чинит проблему, тогда как даже небольшое genre-specific дообучение дает резкий эффект.

Метод. Benchmark строится через automatic pipeline: text-to-music system генерирует genre-conditioned music, затем из него извлекаются genre-aligned scores и auxiliary full-mix ground truth для оценки. Для контроля качества авторы проверяют, что исходные Suno-generated samples разделимы по жанрам: MuQ-MuLan дает Top-1 genre recognition 76% и Top-3 92%. SVS модели оцениваются по pseudo-MOS метрикам SingMOS, SingMOS-Pro, SSQA, lyric intelligibility через CER, а genre alignment - через GCS-5 score.

Результаты. По общей synthesis quality лучшие модели выглядят неплохо: DiffSinger получает SingMOS 4.08, SingMOS-Pro 4.04, SSQA 4.06 и CER 0.31; VISinger2 имеет SSQA 4.07 и CER 0.25. Но genre control слабый: для StyleSinger GCS-5 по Classical/Rock/Rap равен 1.6/1.3/1.4, а style transfer повышает только до 2.6/1.7/1.6 при ground truth 4.2/4.8/4.4. Для TechSinger technique control дает 2.1/1.7/1.5 против baseline 1.7/1.6/1.5. Rock-specific continued training на 2 часах synthetic data поднимает GCS-5 с 1.5 до 4.9.

Ограничения. MMGenre зависит от AI-generated music pipeline, поэтому benchmark сам несет bias text-to-music модели и ее жанровой таксономии. GCS-5 через LLM judge и pseudo-MOS predictors не заменяют полноценную human listening evaluation для всех жанров. Rock fine-tuning может даже преувеличивать subgenre cues, что авторы отмечают как возможную причину score выше ground truth.

Фишка из статьи. Самое цепляющее - отрицательный результат по zero-shot control. Символьная score representation и inference-time подсказки не дают модели настоящую genre awareness; жанровое поведение оказывается в значительной степени привязано к training distribution.

СценарийClassical GCS-5Rock GCS-5Rap GCS-5
StyleSinger1.61.31.4
StyleSinger + style transfer2.61.71.6
TechSinger1.71.61.5
TechSinger + technique control2.11.71.5
Ground truth4.24.84.4
Rock continued training-4.9-

Как это читать: качество вокала и управляемость жанром расходятся. Модель может иметь хороший pseudo-MOS, но оставаться pop-biased; настоящая жанровая специфика появляется только после добавления genre-specific training data.

Оригинальная статья на arXiv