MMGenre: benchmark для genre-aware singing voice synthesis
MMGenre полезна как диагностическая работа для singing voice synthesis: современные SVS модели могут давать приемлемую naturalness, но это не значит, что они действительно управляют музыкальным жанром. Авторы строят benchmark на 10 major genres и 26 subgenres и показывают genre collapse: синтезированные вокалы из разных жанров становятся акустически слишком похожими. Главный вывод не в очередном росте MOS, а в том, что zero-shot genre conditioning почти не чинит проблему, тогда как даже небольшое genre-specific дообучение дает резкий эффект.
Метод. Benchmark строится через automatic pipeline: text-to-music system генерирует genre-conditioned music, затем из него извлекаются genre-aligned scores и auxiliary full-mix ground truth для оценки. Для контроля качества авторы проверяют, что исходные Suno-generated samples разделимы по жанрам: MuQ-MuLan дает Top-1 genre recognition 76% и Top-3 92%. SVS модели оцениваются по pseudo-MOS метрикам SingMOS, SingMOS-Pro, SSQA, lyric intelligibility через CER, а genre alignment - через GCS-5 score.
Результаты. По общей synthesis quality лучшие модели выглядят неплохо: DiffSinger получает SingMOS 4.08, SingMOS-Pro 4.04, SSQA 4.06 и CER 0.31; VISinger2 имеет SSQA 4.07 и CER 0.25. Но genre control слабый: для StyleSinger GCS-5 по Classical/Rock/Rap равен 1.6/1.3/1.4, а style transfer повышает только до 2.6/1.7/1.6 при ground truth 4.2/4.8/4.4. Для TechSinger technique control дает 2.1/1.7/1.5 против baseline 1.7/1.6/1.5. Rock-specific continued training на 2 часах synthetic data поднимает GCS-5 с 1.5 до 4.9.
Ограничения. MMGenre зависит от AI-generated music pipeline, поэтому benchmark сам несет bias text-to-music модели и ее жанровой таксономии. GCS-5 через LLM judge и pseudo-MOS predictors не заменяют полноценную human listening evaluation для всех жанров. Rock fine-tuning может даже преувеличивать subgenre cues, что авторы отмечают как возможную причину score выше ground truth.
Фишка из статьи. Самое цепляющее - отрицательный результат по zero-shot control. Символьная score representation и inference-time подсказки не дают модели настоящую genre awareness; жанровое поведение оказывается в значительной степени привязано к training distribution.
| Сценарий | Classical GCS-5 | Rock GCS-5 | Rap GCS-5 |
|---|---|---|---|
| StyleSinger | 1.6 | 1.3 | 1.4 |
| StyleSinger + style transfer | 2.6 | 1.7 | 1.6 |
| TechSinger | 1.7 | 1.6 | 1.5 |
| TechSinger + technique control | 2.1 | 1.7 | 1.5 |
| Ground truth | 4.2 | 4.8 | 4.4 |
| Rock continued training | - | 4.9 | - |
Как это читать: качество вокала и управляемость жанром расходятся. Модель может иметь хороший pseudo-MOS, но оставаться pop-biased; настоящая жанровая специфика появляется только после добавления genre-specific training data.