Exploring the Design Space of Representation Learning for Audio Transformations
Представление обработанного звука может хранить либо сам эффект, отвлекаясь от источника, либо богатую смесь эффекта и исходного содержания. Работа разводит эти роли в два вектора и показывает: геометрия «чистого преобразования» лучше для поиска и переноса между разными источниками, а более полный вектор — для обучаемых классификаторов и оценки параметров.
Метод. Поверх замороженного кодировщика Stable Audio Open обучается адаптер и три цели: согласованность одного преобразования на разных источниках L_T, сближение с описанием цепочки L_P и эквивариантное предсказание результата L_y. Положительная пара всегда использует другой исходник, а трудные отрицательные примеры — тот же исходник с иной обработкой, что мешает модели угадывать по тембру. Обучение охватывает цепочки из эквалайзеров, фильтров, динамики, искажений, реверберации, задержки и модуляции; проверка использует 67 сторонних модулей Linux.
Результаты. Сочетание L_T+L_P получает в 20-вариантном поиске в среднем 61,1% против 45,2% у AFx-Rep и 36,0% у Fx-Encoder++; при смене инструмента разрыв составляет 49,8% против 20,5% и 13,2%. Полная цель с L_y слегка снижает средний поиск до 60,4%, но повышает macro F1 распознавания цепочки до 60,9. В переносе между инструментами вектор преобразования даёт MRSTFT 0,647 против 0,720 у полного звукового вектора и 0,832 у AFx-Rep, где меньше лучше.
Ограничения. Обучение основано на музыкальных дорожках, искусственно собранных цепочках и специальной нормализации источников; перенос на речь, полевые записи и неизвестные классы обработки не показан. Сто тысяч шагов требуют H100. Нелинейный эффект физически зависит от содержания, поэтому полностью удалить сведения об инструменте невозможно; субъективного прослушивания перенесённого стиля нет.
Фишка из статьи. Эквивариантная цель L_y не является универсально полезной: она улучшает признаки для классификатора, но немного портит расстояния между преобразованиями и усиливает утечку содержания источника.
| Обучение | Средний поиск | Поиск при смене инструмента | Macro F1 цепочки |
|---|---|---|---|
| L_T+L_P | 61,1% | 49,8% | 59,9 |
| L_T+L_P+L_y | 60,4% | 48,7% | 60,9 |
| AFx-Rep | 45,2% | 20,5% | 56,1 |
| Fx-Encoder++ | 36,0% | 13,2% | 48,1 |
Как это читать: добавление L_y переносит полезность из геометрии пространства в доступную классификатору информацию. Выбор представления должен следовать операции: расстояния и поиск предпочитают z_T, обучаемая головка — более насыщенный z_y.