Линейная STFT против HCQT для оценки нескольких высот тона в вокальных ансамблях
Для оценки нескольких одновременно звучащих голосов обычно выбирают HCQT: логарифмическая частотная сетка и гармонические каналы кажутся естественным способом развести близкие основные частоты. Эта работа показывает полезный контрпример: обычная линейная STFT не только заметно дешевле при генерации смесей на лету, но и устойчиво точнее на пяти наборах вокальных ансамблей.
Метод. Авторы оставляют одинаковыми свёрточный вход, 360 выходных высот с шагом 20 центов и кодировщик, меняя только входное представление. HCQT сравнивается с логарифмом модуля STFT: окно 2048 отсчётов, шаг 256, первые 360 линейных частотных отсчётов до 7,7 кГц. Проверены пять кодировщиков примерно на 19 млн параметров и 133,3 часа обучающих вокальных дорожек на нескольких языках.
Результаты. При одинаковом ConvNeXt точность точного совпадения высоты выросла с 0,648 до 0,683 на jaCappella, с 0,492 до 0,533 на ACappellaSet и с 0,584 до 0,614 на корейском наборе. По 2894 проверочным фрагментам абсолютный прирост F1 составил 0,020 с парным 95%-м интервалом [0,018; 0,022]. Лучшим оказалось окно 46 мс: и более короткие, и более длинные окна ухудшали результат; расширение диапазона выше 7,7 кГц также не помогло.
Ограничения. Эталонные F0 в основном получены автоматически с помощью pYIN, поэтому ошибки разметки могут влиять на выводы. Большинство смесей составлено из независимо записанных дорожек и не воспроизводит акустические и интонационные взаимодействия общего помещения; на совместно записанных хорах преимущество менее однозначно. Вывод пока относится к пению, а не к речи и не ко всем музыкальным инструментам.
Фишка из статьи. Выигрыш линейной STFT объясняется не более точной локализацией частоты: HCQT даёт сопоставимую ошибку высоты. Важнее оказался доступ к верхним гармоникам за пределами диапазона предсказываемых F0, тогда как привычное увеличение частотного разрешения само по себе не помогает.
| Представление, ConvNeXt | jaCappella, 20 центов | ACappellaSet | Корейский набор | ChoralSynth |
|---|---|---|---|---|
| HCQT | 0,648 | 0,492 | 0,584 | 0,638 |
| Линейная STFT | 0,683 | 0,533 | 0,614 | 0,657 |
| Разница | +0,035 | +0,041 | +0,030 | +0,019 |
Как это читать: линейная сетка выигрывает на всех четырёх приведённых наборах, но эффект не огромен. Практический вывод сильнее средней прибавки: дорогое гармонически выровненное представление здесь не оправдывает вычислительную цену.