Разделение источников Певческий голос Целевой говорящий
arXiv eess.AS

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

arXiv:2608.14516

Обычный разделитель вокала извлекает сразу всех певцов, что бесполезно, если в дуэте нужен только один голос. Авторы переносят идею выделения целевого говорящего на музыку: короткий фрагмент нужного певца задаёт условие для Open-Unmix и превращает общий вокальный стем в извлечение конкретного исполнителя.

Метод. Двухслойная GRU размерности 32 строит вектор певца по спектрограмме фрагмента длительнее трёх секунд; совпадающие и несовпадающие пары обучают двоичным контрастивным критерием. В Open-Unmix этот вектор либо присоединяется ко входным признакам, либо модулирует промежуточные признаки через FiLM. Модель предсказывает маску амплитудной спектрограммы и использует фазу смеси. Из 41 749 записей DAMP-VSEP после порога DNSMOS 3,0 остаются 14 381 сольная и 6389 дуэтных; синтетическое попарное смешивание даёт 55 780 обучающих дуэтов, а проверка использует только 559 исходных дуэтов.

Результаты. Обычный Open-Unmix получает лишь 0,33 дБ SI-SDR относительно нужного певца, зато 15,88 дБ относительно суммы обоих голосов: он действительно извлекает общий вокал. FiLM с потерей только целевого голоса повышает результат до 3,39 дБ, а присоединение признака с дополнительным критерием остатка и весом 0,1 - до 5,58 дБ. У последнего варианта остаток «другой певец + музыка» достигает 7,98 дБ против 1,47 дБ у исходной системы; FAD остатка падает с 2,44 до 0,06. На сольных записях всё наоборот: исходный Open-Unmix даёт 17,80 дБ, лучше всех условных вариантов.

Ограничения. Рассматриваются только два певца, чистый фрагмент регистрации длиннее трёх секунд и один пользовательский корпус. DAMP-VSEP не связывает личность между песнями, фактически считая каждую композицию отдельным певцом, поэтому представление может запоминать сессию, песню или фон, а не устойчивую личность. Большая часть обучающих дуэтов синтетическая. Использование фазы смеси ограничивает качество при сильном перекрытии, а устойчивость к шумному или ошибочному образцу оставлена на будущее.

Фишка из статьи. Лучший критерий для дуэта ухудшает непосредственное восстановление целевого голоса в некоторых конфигурациях, но резко улучшает физически важный остаток. Таблица также показывает отрицательный результат: условная модель не нужна и даже вредна, когда певец один.

РежимЦелевой певец SI-SDRОстаток дуэта SI-SDRСольный вокал SI-SDR
Open-Unmix без условия0,33 дБ1,47 дБ17,80 дБ
FiLM, только целевой критерий3,39 дБ-2,99 дБ7,26 дБ
Присоединение, двойной критерий, 0,15,58 дБ7,98 дБ9,26 дБ

Как это читать: в дуэте исходная модель принимает обоих певцов за один источник, а условие исправляет саму постановку задачи. Но на сольной записи её преимущество исчезает, поэтому практической системе нужен режим без условия или надёжное определение числа вокалистов.

Оригинальная статья на arXiv