Синтез пения Diffusion Score
Синтез пения

VocalRender: score-native синтез пения без duration predictor

WER 3.88

VocalRender рассматривает синтез пения как задачу генерации прямо из музыкальной партитуры, без заранее заданных длительностей слогов и без time-aligned acoustic guidance. Это интересно для синтеза речи и пения, потому что обычные неавторегрессионные системы часто требуют готовый акустический холст: сначала предсказать длины, а потом заполнять спектр. Здесь модель сама выводит локальный тайминг и общую длину из текста, нот, symbolic note values и темпа.

Метод. Вход задается как interleaved lyric-note representation: слоги и назначенные им MIDI pitches с нотными длительностями подаются в одном score-native формате. Autoregressive diffusion model генерирует непрерывные acoustic latents и одновременно фактически определяет длину выхода, вместо отдельного duration predictor. Для тембра используется 2-8 секунд reference audio из той же песни, backbone инициализируется речевыми весами VoxCPM2, а VocalRender обучается на CrawlSinger-OS, примерно 2300 часов singing data.

Результаты. На Opencpop VocalRender получает WER 4.44, SIM 0.922, IOU 0.62, RPA 0.72 и SingMOS 4.59; VocalRender-Pro улучшает WER до 3.88 и SIM до 0.929. На out-of-domain CrawlSinger-Eval обычный VocalRender дает WER 4.52 и SIM 0.919, Pro - WER 4.45 и SIM 0.926. По субъективной naturalness CMOS сильнейший baseline SoulX-Singer имеет -0.42 относительно VocalRender, а VocalRender-Pro получает +0.13, но его MS-MOS ниже, чем у базового VocalRender.

Ограничения. Это синтез пения, а не разговорной речи: мелодия, дыхание, протяжные гласные и melisma меняют постановку. Автоматический WER считается через Qwen3-ASR на singing audio, что удобно, но зависит от качества самого распознавателя. Данные крупные и частично web-crawled, проверка на leakage делается фильтрацией по lyric similarity, а real-time режим и ручное управление микротаймингом не анализируются.

Фишка из статьи. Субъективная таблица показывает не просто победу над baseline, а trade-off внутри самой системы: Pro звучит естественнее, но хуже следует партитуре по MS-MOS.

МетодN-CMOS выше лучшеPS-CMOS выше лучшеMS-MOS выше лучше
SoulX-Singer-0.42 +/- 0.28-0.32 +/- 0.242.84 +/- 0.22
VocalRender002.96 +/- 0.22
VocalRender-Pro+0.13 +/- 0.27+0.06 +/- 0.222.71 +/- 0.27

Как это читать: больше данных и более сильная модель улучшают естественность и просодическое сходство, но score-following может просесть. Для композитора это важная инженерная деталь: лучший голос не всегда означает лучшее следование партитуре.

Оригинальная статья на arXiv