Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures
Обычный разделитель вокала извлекает сразу всех певцов, что бесполезно, если в дуэте нужен только один голос. Авторы переносят идею выделения целевого говорящего на музыку: короткий фрагмент нужного певца задаёт условие для Open-Unmix и превращает общий вокальный стем в извлечение конкретного исполнителя.
Метод. Двухслойная GRU размерности 32 строит вектор певца по спектрограмме фрагмента длительнее трёх секунд; совпадающие и несовпадающие пары обучают двоичным контрастивным критерием. В Open-Unmix этот вектор либо присоединяется ко входным признакам, либо модулирует промежуточные признаки через FiLM. Модель предсказывает маску амплитудной спектрограммы и использует фазу смеси. Из 41 749 записей DAMP-VSEP после порога DNSMOS 3,0 остаются 14 381 сольная и 6389 дуэтных; синтетическое попарное смешивание даёт 55 780 обучающих дуэтов, а проверка использует только 559 исходных дуэтов.
Результаты. Обычный Open-Unmix получает лишь 0,33 дБ SI-SDR относительно нужного певца, зато 15,88 дБ относительно суммы обоих голосов: он действительно извлекает общий вокал. FiLM с потерей только целевого голоса повышает результат до 3,39 дБ, а присоединение признака с дополнительным критерием остатка и весом 0,1 - до 5,58 дБ. У последнего варианта остаток «другой певец + музыка» достигает 7,98 дБ против 1,47 дБ у исходной системы; FAD остатка падает с 2,44 до 0,06. На сольных записях всё наоборот: исходный Open-Unmix даёт 17,80 дБ, лучше всех условных вариантов.
Ограничения. Рассматриваются только два певца, чистый фрагмент регистрации длиннее трёх секунд и один пользовательский корпус. DAMP-VSEP не связывает личность между песнями, фактически считая каждую композицию отдельным певцом, поэтому представление может запоминать сессию, песню или фон, а не устойчивую личность. Большая часть обучающих дуэтов синтетическая. Использование фазы смеси ограничивает качество при сильном перекрытии, а устойчивость к шумному или ошибочному образцу оставлена на будущее.
Фишка из статьи. Лучший критерий для дуэта ухудшает непосредственное восстановление целевого голоса в некоторых конфигурациях, но резко улучшает физически важный остаток. Таблица также показывает отрицательный результат: условная модель не нужна и даже вредна, когда певец один.
| Режим | Целевой певец SI-SDR | Остаток дуэта SI-SDR | Сольный вокал SI-SDR |
|---|---|---|---|
| Open-Unmix без условия | 0,33 дБ | 1,47 дБ | 17,80 дБ |
| FiLM, только целевой критерий | 3,39 дБ | -2,99 дБ | 7,26 дБ |
| Присоединение, двойной критерий, 0,1 | 5,58 дБ | 7,98 дБ | 9,26 дБ |
Как это читать: в дуэте исходная модель принимает обоих певцов за один источник, а условие исправляет саму постановку задачи. Но на сольной записи её преимущество исчезает, поэтому практической системе нужен режим без условия или надёжное определение числа вокалистов.