представления звуковых преобразований звуковые эффекты перенос обработки
arXiv cs.SD

Exploring the Design Space of Representation Learning for Audio Transformations

arXiv:2608.28127

Представление обработанного звука может хранить либо сам эффект, отвлекаясь от источника, либо богатую смесь эффекта и исходного содержания. Работа разводит эти роли в два вектора и показывает: геометрия «чистого преобразования» лучше для поиска и переноса между разными источниками, а более полный вектор — для обучаемых классификаторов и оценки параметров.

Метод. Поверх замороженного кодировщика Stable Audio Open обучается адаптер и три цели: согласованность одного преобразования на разных источниках L_T, сближение с описанием цепочки L_P и эквивариантное предсказание результата L_y. Положительная пара всегда использует другой исходник, а трудные отрицательные примеры — тот же исходник с иной обработкой, что мешает модели угадывать по тембру. Обучение охватывает цепочки из эквалайзеров, фильтров, динамики, искажений, реверберации, задержки и модуляции; проверка использует 67 сторонних модулей Linux.

Результаты. Сочетание L_T+L_P получает в 20-вариантном поиске в среднем 61,1% против 45,2% у AFx-Rep и 36,0% у Fx-Encoder++; при смене инструмента разрыв составляет 49,8% против 20,5% и 13,2%. Полная цель с L_y слегка снижает средний поиск до 60,4%, но повышает macro F1 распознавания цепочки до 60,9. В переносе между инструментами вектор преобразования даёт MRSTFT 0,647 против 0,720 у полного звукового вектора и 0,832 у AFx-Rep, где меньше лучше.

Ограничения. Обучение основано на музыкальных дорожках, искусственно собранных цепочках и специальной нормализации источников; перенос на речь, полевые записи и неизвестные классы обработки не показан. Сто тысяч шагов требуют H100. Нелинейный эффект физически зависит от содержания, поэтому полностью удалить сведения об инструменте невозможно; субъективного прослушивания перенесённого стиля нет.

Фишка из статьи. Эквивариантная цель L_y не является универсально полезной: она улучшает признаки для классификатора, но немного портит расстояния между преобразованиями и усиливает утечку содержания источника.

ОбучениеСредний поискПоиск при смене инструментаMacro F1 цепочки
L_T+L_P61,1%49,8%59,9
L_T+L_P+L_y60,4%48,7%60,9
AFx-Rep45,2%20,5%56,1
Fx-Encoder++36,0%13,2%48,1

Как это читать: добавление L_y переносит полезность из геометрии пространства в доступную классификатору информацию. Выбор представления должен следовать операции: расстояния и поиск предпочитают z_T, обучаемая головка — более насыщенный z_y.

Оригинальная статья на arXiv