RelFx: относительные представления аудиоэффектов без dry reference
RelFx занимается аудиоэффектами в более реалистичной постановке: в реальной музыке часто нет dry reference, то есть чистой версии до обработки. Вместо того чтобы пытаться восстановить абсолютный preset эффекта, авторы учат относительное представление преобразования между двумя уже обработанными сигналами. Это полезно для поиска похожей обработки, переноса эффекта и анализа микса без недоступного исходника.
Метод. Модель получает пару фрагментов и учится кодировать различие эффектов через contrastive distance learning. Ключевой прием - подбирать пары из одной песни и похожих секций, чтобы контент был близок, а различие больше относилось к обработке. Архитектура использует две ветви и cross-attention; отдельные ablation убирают cross-segment sampling, регрессию параметров, динамическую вероятность эффектов и двунаправленное обучение.
Результаты. На задаче style transfer по median multi-resolution STFT loss RelFx Standard дает 1.388, Self-ref - 1.399, MoisesDB - 1.449, тогда как Fx-Encoder++ получает 1.601, AFx-Rep - 1.517, CLAP - 1.644. Для MoisesDB вариант RelFx улучшает Fx-Encoder++ примерно на 9.5% относительно. В retrieval full model дает R@1 67.3, R@5 79.2 и R@10 83.7, но абляции показывают, что retrieval и качество переноса эффекта не всегда движутся вместе.
Ограничения. Метод кодирует общую трансформацию между фрагментами и пока не разделяет source-specific эффекты внутри сложного микса. Обобщение на невиданные цепочки обработки и реальные продакшеновые routing-схемы остается открытым. Метрики основаны на спектральном расстоянии и retrieval, поэтому субъективное восприятие эффекта покрыто косвенно.
Фишка из статьи. Самая показательная абляция - случай, где retrieval улучшается, а перенос эффекта резко ломается. Это редкий и полезный negative result.
| Вариант | R@1 | Ld, ниже лучше |
|---|---|---|
| Full model | 67.3 | 1.399 |
| Без cross-attention | 65.6 | 1.392 |
| Без cross-segment sampling | 69.6 | 1.876 |
| Single-branch | 46.1 | 1.457 |
Как это читать: лучшее попадание в retrieval не означает лучший эффект при применении. Cross-segment sampling не максимизирует R@1, но помогает выучить представление, которое переносит обработку, а не просто группирует похожие фрагменты.