Diff2Mix: управляемое музыкальное сведение через диффузию и аудиоэффекты
Diff2Mix рассматривает автоматическое музыкальное сведение как управляемую генерацию параметров аудиоэффектов, а не как черный ящик, который сразу выдает готовый микс. Это полезно для аудиоинженерии: результат можно не только оценить на слух, но и править через понятные ручки - громкость, эквалайзер, компрессию, панораму и реверберацию. Главный ход статьи - соединить диффузионную модель со дифференцируемой микшерной консолью.
Метод. Система использует цепочку эффектов Gain → parametric EQ → dynamic range compressor → stereo panning → artificial reverb send. Diff2Mix-P прямо предсказывает параметры консоли, а Diff2Mix-D моделирует распределение параметров через гауссово ядро и deep sigmoidal flow с энтропийной регуляризацией. Пользователь может задать эталонный трек для общего стиля сведения или явно поправить параметры эффектов.
Результаты. На метриках стиля сведения Diff2Mix-D получает SCE 1288.95, LUFS 2.22, MSD 1.10 и SW 1.86, что лучше или сопоставимо с Diff-MST и ST-ITO по нескольким осям. В объективной оценке качества микса Diff2Mix-D снижает KAD по FxEncoder с 41.69 у Diff2Mix-P до 30.60, а Diff2Mix-P дает сильные результаты по RMS и управляемости. В слушательском тесте участвовали 20 профессионально связанных со сведением участников; авторы сообщают, что Diff2Mix-P по качеству сведения статистически достигает уровня человеческого микса в этой постановке.
Ограничения. Слушательский тест мал: всего три мультитрека и три эталонных референса. Глобальное стилевое вложение иногда не переносит трек-специфичные решения, например для рок-референса. Кроме того, работа не доказывает пригодность для реального времени и сильно зависит от выбранной фиксированной цепочки эффектов.
Фишка из статьи. В статье хорошо виден компромисс между прямым предсказанием параметров и вероятностным моделированием параметров. Diff2Mix-D лучше ловит стиль по ряду численных метрик, а Diff2Mix-P сильнее в субъективном качестве и редактируемости.
| Система | SCE ниже лучше | LUFS ниже лучше | MSD ниже лучше | SW ниже лучше |
|---|---|---|---|---|
| Diff-MST | 1490.00 | 3.18 | 1.37 | 3.34 |
| ST-ITO | 1393.15 | 5.24 | 1.28 | 13.04 |
| Diff2Mix-P | 1400.93 | 3.10 | 1.12 | 1.79 |
| Diff2Mix-D | 1288.95 | 2.22 | 1.10 | 1.86 |
Как это читать: эти метрики сравнивают стилевое и сигнальное сходство с целевым сведением; ниже значит ближе. Diff2Mix-D лучше по SCE, LUFS и MSD, но небольшая разница с Diff2Mix-P показывает, что вероятностность параметров дает не универсальную победу, а другой режим управления.