SheetSage-A2S: аудио-в-ноты для популярной музыки
SheetSage-A2S расширяет audio-to-score transcription за пределы классических квартетов: авторы собирают корпус популярных песен, где аудио связано с lead-sheet разметкой в формате **kern. Это полезно для аудиоанализа, потому что популярная музыка содержит вокал, аккорды, неоднородные пользовательские аннотации и гораздо менее академичный формат нотации. Главный технический ход - заменить CNN-энкодер на предобученные MuQ-признаки и усилить обучение транспонированием и растяжением времени.
Метод. Набор строится из SheetSage-аннотаций и YouTube-аудио: после загрузки 20 072 клипов из исходных 26 175 и фильтрации остается 9468 клипов из 6066 песен 2891 исполнителя, суммарно 61 час. Для вокальных мелодий используется source separation и RMVPE/PESTO-подобная оценка высоты для восстановления абсолютной октавы, после чего мелодия и аккорды переводятся в **kern. Модель - autoregressive Transformer decoder, который вместо исходного CNN получает MuQ features с 24 кГц аудио.
Результаты. На классическом Quartets наборе итоговая модель снижает SER с 15.3 до 4.98, то есть на 67.5% относительно. На новом SheetSage-A2S исходная база имеет SER 66.85, 1024-PreNorm снижает его до 53.70, MuQ - до 25.39, а аугментация - до 20.92. Отдельно по спайнам на SheetSage-A2S итоговая модель дает melody SER 38.62 и chord SER 22.28, что показывает: мелодия вокала остается сложнее общей sequence-метрики.
Ограничения. Пользовательские аннотации не стандартизированы: люди по-разному отмечают повторы аккордов, ритмические страмы, слоги и ноты. SER может штрафовать модель за музыкально приемлемые расхождения, например за чуть другой note offset или разбиение одной вокальной ноты. Корпус также не распространяет copyrighted audio, а дает ссылки, таймстемпы и предвычисленные признаки, что влияет на воспроизводимость.
Фишка из статьи. Абляция показывает, что основной скачок на популярной музыке дает именно предобученный аудиоэнкодер MuQ, а не только увеличение Transformer-блока. Это логично: MuQ обучался на крупном музыкальном корпусе и лучше переносит жанровые признаки SheetSage-A2S.
| Вариант | SheetSage-A2S SER | Melody SER | Chord SER | Quartets SER |
|---|---|---|---|---|
| Базовая модель | 66.85 | 106.88 | 64.12 | 15.30 |
| +1024-PreNorm | 53.70 | 90.56 | 51.80 | 8.48 |
| +MuQ encoder | 25.39 | 46.21 | 26.76 | 7.16 |
| +аугментация данных | 20.92 | 38.62 | 22.28 | 4.98 |
Как это читать: SER - Levenshtein-ошибка по символам/токенам партитуры; ниже лучше. На SheetSage-A2S переход к MuQ уменьшает SER почти вдвое относительно 1024-PreNorm, а аугментация добавляет меньший, но стабильный выигрыш.