Аудио Сведение Flow Matching
arXiv eess.AS

Sequential Stem Blending: музыкальное сведение по дорожкам, а не одним проходом

arXiv:2608.05506

Эта работа предлагает пересобрать автоматическое музыкальное сведение ближе к тому, как действует звукорежиссер: не обрабатывать все дорожки одним параллельным проходом, а по одной добавлять дорожку в уже существующий подмикс. Такой подход делает промежуточные состояния видимыми и потенциально редактируемыми. Главный технический ход - обучить модель переноса в скрытом пространстве, которая знает не только новую дорожку, но и текущий контекст микса.

Метод. Авторы формулируют задачу stem blending: входная дорожка кодируется вместе с текущим подмиксом через VAE, а rectified flow matching переводит скрытое представление необработанной дорожки в обработанное. Для обучения используются MedleyDB v1 с парами raw/wet и MoisesDB; чтобы получить реалистичные пары для смешивания, авторы синтезируют деградации через эквалайзер, перекрытие частотных областей и случайную комнатную реверберацию. На полном сведении дорожки идут либо в случайном порядке, либо в порядке по предметному знанию.

Результаты. На задаче добавления одной дорожки в подмикс предложенная модель резко снижает KAD: FxEnc++ KAD равен -0.01 и CLAP KAD -0.07 против 1.42/1.61 у Raw-mix, 46.45/1.76 у DMC и 11.67/8.18 у MEGAMI. На полном сведении MedleyDB v2 вариант с предметным порядком дает CLAP KAD 6.52 против 9.82 у Raw-mix и 11.61 у DMC, но по FxEnc++ KAD уступает MEGAMI: 31.01 против 7.99. По оценке Meta Audiobox Aesthetics предложенная модель имеет общий PQ 7.971, выше Raw-mix 7.737, DMC 7.734 и MEGAMI 7.653.

Ограничения. Полное автоматическое сведение еще не превосходит лучшие системы по тональному балансу и стилевому сходству. Производительность зависит от порядка дорожек, а начальный подмикс остается отдельным инженерным выбором. Кроме того, оценка на сгенерированных вне распределения стемах полезна, но не заменяет большого слушательского теста на реальных мультитреках.

Фишка из статьи. Необычная часть - отрицательный вывод про параллельные системы в задаче добавления одной дорожки. Когда модель обучена менять весь микс сразу, она может портить уже готовый подмикс; последовательная постановка явно запрещает такой сценарий.

Stem blending, MoisesDBFxEnc++ KAD ниже лучшеCLAP KAD ниже лучшеRMS FD ниже лучше
Raw-mix1.421.614.86e+02
DMC46.451.761.71e+03
MEGAMI11.678.182.60e+03
Предложенная модель-0.01-0.075.37e+00

Как это читать: в stem blending оценивается не весь микс, а добавление одной дорожки к уже существующему подмиксу. Малые KAD и FD означают, что модель ведет себя как локальный обработчик новой дорожки, а не как система, которая заново перекрашивает весь микс.

Оригинальная статья на arXiv