Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction
Эта работа о музыке, но её основной ход напрямую интересен для фазо-зависимого улучшения речи и звука: вместо неявного восстановления фазы из временного сигнала автоэнкодер сжимает комплексный STFT и получает физическую ось частоты для разных правил коррекции. Авторы не заявляют, что спектральное представление лучше во всём. Они показывают более узкий и полезный результат: при равном бюджете оно лучше сохраняет полный и верхний диапазон, а фазу, амплитуду и стереофонические признаки можно исправлять там, где они действительно важны.
Метод. Стереозвук 48 кГц переводится в комплексный STFT с размером преобразования 960, шагом 480 отсчётов и частотным разрешением 50 Гц. Кодировщик сжимает 480 рабочих частотных ячеек в непрерывное 128-мерное представление с частотой 25 Гц; отдельный вокодер не нужен, потому что декодер сразу выдаёт действительную и мнимую части спектра для обратного STFT. Нелинейность Spec-SnakeBeta обучает периодический отклик отдельно для каждой физической частоты, но разделяет параметры между внутренними каналами. После основного обучения замороженный декодер дополняется нулевым по инициализации корректором: ниже 1,5 кГц он меняет только фазу, от 1,5 до 4 кГц - фазу и модуль, выше 4 кГц - только модуль. Такое деление следует дуплексной теории слуховой локализации.
Результаты. В контролируемом сравнении моделей по 3,0-3,1 млн параметров комплексный STFT получил полную спектральную дистанцию 1,122 против 1,294 у фрагментов временного сигнала, а выше 8 кГц - 1,178 против 1,513, то есть на 22% меньше. На 546 композициях Song Describer полный ear-VAE2 дал лучшие точечные значения по пяти из семи метрик и сравнялся по межканальной фазовой согласованности CCPC: 0,973. Корректор снизил Mel Distance с 0,572 до 0,461, на 19,4%, и SPE с 0,268 до 0,264. Частотная Spec-SnakeBeta превзошла независимую параметризацию по всем шести метрикам, используя 2 730 параметров активации вместо 350 720. В генерации 100 английских и 100 китайских песен замена скрытого пространства улучшила все 12 автоматических оценок, но это не прослушивание.
Ограничения. Проверена музыка, а не речь, удаление реверберации или подавление шума; перенос частотных границ и фазовых правил на эти задачи ещё нужно показать. Полная модель обучена примерно на двух миллионах общедоступных композиций и 10 тыс. часов закрытой музыки, что осложняет воспроизведение. Межсистемное сравнение использует родные конфигурации моделей, поэтому строго контролируемыми являются только внутренние опыты. Субъективная проверка корректора включает 10 профессиональных инженеров и 20 десятисекундных фрагментов. Коэффициент реального времени и задержка не приведены.
Фишка из статьи. Ограничение корректора по частотным полосам оказалось не компромиссом, а полезной физической регуляризацией. Он выдаёт почти вдвое меньше поправок, чем вариант, который меняет модуль и фазу везде, но лучше сохраняет спектр, низкочастотную межушную фазу и межушные уровни. Профессиональные слушатели тоже предпочли более ограниченную схему.
| Корректор | Выходов на канал | Mel Distance | STFT Distance | Ошибка IPD ниже 1,5 кГц | Оценка инженеров |
|---|---|---|---|---|---|
| Полосовой | 532 | 0,658 | 1,019 | 0,7963 рад | 0,75 |
| Неограниченный | 962 | 0,705 | 1,120 | 0,8155 рад | 0,66 |
Как это читать: полосовая схема сокращает размер выхода примерно на 45%, однако выигрывает и по объективным показателям, и по прослушиванию. Практический вывод для фазо-зависимых систем состоит не в том, чтобы «предсказывать больше», а в том, чтобы связывать тип поправки с физикой слуха и частотной областью.