Аудио Сведение Diffusion
arXiv eess.AS

Diff2Mix: управляемое музыкальное сведение через диффузию и аудиоэффекты

arXiv:2608.05442

Diff2Mix рассматривает автоматическое музыкальное сведение как управляемую генерацию параметров аудиоэффектов, а не как черный ящик, который сразу выдает готовый микс. Это полезно для аудиоинженерии: результат можно не только оценить на слух, но и править через понятные ручки - громкость, эквалайзер, компрессию, панораму и реверберацию. Главный ход статьи - соединить диффузионную модель со дифференцируемой микшерной консолью.

Метод. Система использует цепочку эффектов Gain → parametric EQ → dynamic range compressor → stereo panning → artificial reverb send. Diff2Mix-P прямо предсказывает параметры консоли, а Diff2Mix-D моделирует распределение параметров через гауссово ядро и deep sigmoidal flow с энтропийной регуляризацией. Пользователь может задать эталонный трек для общего стиля сведения или явно поправить параметры эффектов.

Результаты. На метриках стиля сведения Diff2Mix-D получает SCE 1288.95, LUFS 2.22, MSD 1.10 и SW 1.86, что лучше или сопоставимо с Diff-MST и ST-ITO по нескольким осям. В объективной оценке качества микса Diff2Mix-D снижает KAD по FxEncoder с 41.69 у Diff2Mix-P до 30.60, а Diff2Mix-P дает сильные результаты по RMS и управляемости. В слушательском тесте участвовали 20 профессионально связанных со сведением участников; авторы сообщают, что Diff2Mix-P по качеству сведения статистически достигает уровня человеческого микса в этой постановке.

Ограничения. Слушательский тест мал: всего три мультитрека и три эталонных референса. Глобальное стилевое вложение иногда не переносит трек-специфичные решения, например для рок-референса. Кроме того, работа не доказывает пригодность для реального времени и сильно зависит от выбранной фиксированной цепочки эффектов.

Фишка из статьи. В статье хорошо виден компромисс между прямым предсказанием параметров и вероятностным моделированием параметров. Diff2Mix-D лучше ловит стиль по ряду численных метрик, а Diff2Mix-P сильнее в субъективном качестве и редактируемости.

СистемаSCE ниже лучшеLUFS ниже лучшеMSD ниже лучшеSW ниже лучше
Diff-MST1490.003.181.373.34
ST-ITO1393.155.241.2813.04
Diff2Mix-P1400.933.101.121.79
Diff2Mix-D1288.952.221.101.86

Как это читать: эти метрики сравнивают стилевое и сигнальное сходство с целевым сведением; ниже значит ближе. Diff2Mix-D лучше по SCE, LUFS и MSD, но небольшая разница с Diff2Mix-P показывает, что вероятностность параметров дает не универсальную победу, а другой режим управления.

Оригинальная статья на arXiv