Pansori mode classification: частотно-высотные и тембровые признаки вокальной традиции
Статья переносит классификацию ладов Pansori из нотного анализа в покадровый анализ вокального аудио. Задача интересна для речевых и музыкальных технологий тем, что лад здесь задается не только высотным набором, но и микротональной орнаментикой, тембром и ударным сопровождением. Авторы строят 46-часовую экспертную разметку и сравнивают mel-спектрограммы, F0-контур, MIDI piano roll и CultureMERT.
Метод. Пять канонических batang размечены профессиональным исполнителем Pansori на уровне кадров; модели предсказывают четыре класса: Ujo, Gyemyeonjo, Aniri и Changjo. Mel-Original работает по исходному звуку, Mel-Sep - по вокалу после разделения источников, F0-модель использует PESTO и Conv1DGRU, MIDI-вариант переводит высотный контур в piano-roll, а CultureMERT проверяет универсальное самоконтролируемое музыкальное представление. Два split-режима отделяют обычную проверку от строгого work-level переноса.
Результаты. Лучший общий masked macro-F1 дает Mel-Original: 0.871 на Daemok-Shared и 0.785 на Work-level. По трем хорошо представленным модам разрыв между split-режимами составляет только 2.1-3.6 F1-пункта, что говорит против простого запоминания произведений. Но Changjo ломает macro-F1: его доля всего 1.8% размеченных кадров, а при разделении источников F1 по Changjo падает с 0.831 до 0.632 на Daemok-Shared и с 0.571 до 0.504 на Work-level.
Ограничения. Это культурно специфичный вокальный корпус, и результаты нельзя прямо переносить на другие традиции или обычную речь. Классы сильно несбалансированы, особенно Changjo, поэтому macro-F1 чувствителен к редким режимам. Кроме того, универсальное предобучение CultureMERT оказывается слабым на различении Ujo и Gyemyeonjo, что ограничивает надежду на «готовые» музыкальные признаки.
Фишка из статьи. Самая интересная DSP/MIR-деталь: разделение источников помогает выделить вокал, но удаляет ударный cue, который нужен для Changjo. То есть стандартная предобработка «очистим вокал» может убрать музыкально значимый признак.
| Представление | Macro-F1 shared | Changjo shared | Macro-F1 work-level | Changjo work-level |
|---|---|---|---|---|
| Mel-Original | 0.871 | 0.831 | 0.785 | 0.571 |
| Mel-Sep | 0.821 | 0.632 | 0.762 | 0.504 |
| F0 | 0.743 | 0.508 | 0.683 | 0.343 |
| MIDI | 0.689 | 0.419 | 0.626 | 0.233 |
| CultureMERT | 0.696 | 0.551 | 0.539 | 0.175 |
Как это читать: Mel-Sep почти не хуже Mel-Original для Ujo, Gyemyeonjo и Aniri, но резко хуже для Changjo. Это указывает не на общую слабость source separation, а на конкретную потерю барабанного контекста, который является частью определения класса.