Sequential Stem Blending: музыкальное сведение по дорожкам, а не одним проходом
Эта работа предлагает пересобрать автоматическое музыкальное сведение ближе к тому, как действует звукорежиссер: не обрабатывать все дорожки одним параллельным проходом, а по одной добавлять дорожку в уже существующий подмикс. Такой подход делает промежуточные состояния видимыми и потенциально редактируемыми. Главный технический ход - обучить модель переноса в скрытом пространстве, которая знает не только новую дорожку, но и текущий контекст микса.
Метод. Авторы формулируют задачу stem blending: входная дорожка кодируется вместе с текущим подмиксом через VAE, а rectified flow matching переводит скрытое представление необработанной дорожки в обработанное. Для обучения используются MedleyDB v1 с парами raw/wet и MoisesDB; чтобы получить реалистичные пары для смешивания, авторы синтезируют деградации через эквалайзер, перекрытие частотных областей и случайную комнатную реверберацию. На полном сведении дорожки идут либо в случайном порядке, либо в порядке по предметному знанию.
Результаты. На задаче добавления одной дорожки в подмикс предложенная модель резко снижает KAD: FxEnc++ KAD равен -0.01 и CLAP KAD -0.07 против 1.42/1.61 у Raw-mix, 46.45/1.76 у DMC и 11.67/8.18 у MEGAMI. На полном сведении MedleyDB v2 вариант с предметным порядком дает CLAP KAD 6.52 против 9.82 у Raw-mix и 11.61 у DMC, но по FxEnc++ KAD уступает MEGAMI: 31.01 против 7.99. По оценке Meta Audiobox Aesthetics предложенная модель имеет общий PQ 7.971, выше Raw-mix 7.737, DMC 7.734 и MEGAMI 7.653.
Ограничения. Полное автоматическое сведение еще не превосходит лучшие системы по тональному балансу и стилевому сходству. Производительность зависит от порядка дорожек, а начальный подмикс остается отдельным инженерным выбором. Кроме того, оценка на сгенерированных вне распределения стемах полезна, но не заменяет большого слушательского теста на реальных мультитреках.
Фишка из статьи. Необычная часть - отрицательный вывод про параллельные системы в задаче добавления одной дорожки. Когда модель обучена менять весь микс сразу, она может портить уже готовый подмикс; последовательная постановка явно запрещает такой сценарий.
| Stem blending, MoisesDB | FxEnc++ KAD ниже лучше | CLAP KAD ниже лучше | RMS FD ниже лучше |
|---|---|---|---|
| Raw-mix | 1.42 | 1.61 | 4.86e+02 |
| DMC | 46.45 | 1.76 | 1.71e+03 |
| MEGAMI | 11.67 | 8.18 | 2.60e+03 |
| Предложенная модель | -0.01 | -0.07 | 5.37e+00 |
Как это читать: в stem blending оценивается не весь микс, а добавление одной дорожки к уже существующему подмиксу. Малые KAD и FD означают, что модель ведет себя как локальный обработчик новой дорожки, а не как система, которая заново перекрашивает весь микс.