Музыкальная транскрипция MuQ Dataset
arXiv cs.SD

SheetSage-A2S: аудио-в-ноты для популярной музыки

arXiv:2608.06165

SheetSage-A2S расширяет audio-to-score transcription за пределы классических квартетов: авторы собирают корпус популярных песен, где аудио связано с lead-sheet разметкой в формате **kern. Это полезно для аудиоанализа, потому что популярная музыка содержит вокал, аккорды, неоднородные пользовательские аннотации и гораздо менее академичный формат нотации. Главный технический ход - заменить CNN-энкодер на предобученные MuQ-признаки и усилить обучение транспонированием и растяжением времени.

Метод. Набор строится из SheetSage-аннотаций и YouTube-аудио: после загрузки 20 072 клипов из исходных 26 175 и фильтрации остается 9468 клипов из 6066 песен 2891 исполнителя, суммарно 61 час. Для вокальных мелодий используется source separation и RMVPE/PESTO-подобная оценка высоты для восстановления абсолютной октавы, после чего мелодия и аккорды переводятся в **kern. Модель - autoregressive Transformer decoder, который вместо исходного CNN получает MuQ features с 24 кГц аудио.

Результаты. На классическом Quartets наборе итоговая модель снижает SER с 15.3 до 4.98, то есть на 67.5% относительно. На новом SheetSage-A2S исходная база имеет SER 66.85, 1024-PreNorm снижает его до 53.70, MuQ - до 25.39, а аугментация - до 20.92. Отдельно по спайнам на SheetSage-A2S итоговая модель дает melody SER 38.62 и chord SER 22.28, что показывает: мелодия вокала остается сложнее общей sequence-метрики.

Ограничения. Пользовательские аннотации не стандартизированы: люди по-разному отмечают повторы аккордов, ритмические страмы, слоги и ноты. SER может штрафовать модель за музыкально приемлемые расхождения, например за чуть другой note offset или разбиение одной вокальной ноты. Корпус также не распространяет copyrighted audio, а дает ссылки, таймстемпы и предвычисленные признаки, что влияет на воспроизводимость.

Фишка из статьи. Абляция показывает, что основной скачок на популярной музыке дает именно предобученный аудиоэнкодер MuQ, а не только увеличение Transformer-блока. Это логично: MuQ обучался на крупном музыкальном корпусе и лучше переносит жанровые признаки SheetSage-A2S.

ВариантSheetSage-A2S SERMelody SERChord SERQuartets SER
Базовая модель66.85106.8864.1215.30
+1024-PreNorm53.7090.5651.808.48
+MuQ encoder25.3946.2126.767.16
+аугментация данных20.9238.6222.284.98

Как это читать: SER - Levenshtein-ошибка по символам/токенам партитуры; ниже лучше. На SheetSage-A2S переход к MuQ уменьшает SER почти вдвое относительно 1024-PreNorm, а аугментация добавляет меньший, но стабильный выигрыш.

Оригинальная статья на arXiv