Фаза и стерео Спектральный автоэнкодер Частотно-временной анализ
arXiv cs.SD

Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction

arXiv:2608.19843

Эта работа о музыке, но её основной ход напрямую интересен для фазо-зависимого улучшения речи и звука: вместо неявного восстановления фазы из временного сигнала автоэнкодер сжимает комплексный STFT и получает физическую ось частоты для разных правил коррекции. Авторы не заявляют, что спектральное представление лучше во всём. Они показывают более узкий и полезный результат: при равном бюджете оно лучше сохраняет полный и верхний диапазон, а фазу, амплитуду и стереофонические признаки можно исправлять там, где они действительно важны.

Метод. Стереозвук 48 кГц переводится в комплексный STFT с размером преобразования 960, шагом 480 отсчётов и частотным разрешением 50 Гц. Кодировщик сжимает 480 рабочих частотных ячеек в непрерывное 128-мерное представление с частотой 25 Гц; отдельный вокодер не нужен, потому что декодер сразу выдаёт действительную и мнимую части спектра для обратного STFT. Нелинейность Spec-SnakeBeta обучает периодический отклик отдельно для каждой физической частоты, но разделяет параметры между внутренними каналами. После основного обучения замороженный декодер дополняется нулевым по инициализации корректором: ниже 1,5 кГц он меняет только фазу, от 1,5 до 4 кГц - фазу и модуль, выше 4 кГц - только модуль. Такое деление следует дуплексной теории слуховой локализации.

Результаты. В контролируемом сравнении моделей по 3,0-3,1 млн параметров комплексный STFT получил полную спектральную дистанцию 1,122 против 1,294 у фрагментов временного сигнала, а выше 8 кГц - 1,178 против 1,513, то есть на 22% меньше. На 546 композициях Song Describer полный ear-VAE2 дал лучшие точечные значения по пяти из семи метрик и сравнялся по межканальной фазовой согласованности CCPC: 0,973. Корректор снизил Mel Distance с 0,572 до 0,461, на 19,4%, и SPE с 0,268 до 0,264. Частотная Spec-SnakeBeta превзошла независимую параметризацию по всем шести метрикам, используя 2 730 параметров активации вместо 350 720. В генерации 100 английских и 100 китайских песен замена скрытого пространства улучшила все 12 автоматических оценок, но это не прослушивание.

Ограничения. Проверена музыка, а не речь, удаление реверберации или подавление шума; перенос частотных границ и фазовых правил на эти задачи ещё нужно показать. Полная модель обучена примерно на двух миллионах общедоступных композиций и 10 тыс. часов закрытой музыки, что осложняет воспроизведение. Межсистемное сравнение использует родные конфигурации моделей, поэтому строго контролируемыми являются только внутренние опыты. Субъективная проверка корректора включает 10 профессиональных инженеров и 20 десятисекундных фрагментов. Коэффициент реального времени и задержка не приведены.

Фишка из статьи. Ограничение корректора по частотным полосам оказалось не компромиссом, а полезной физической регуляризацией. Он выдаёт почти вдвое меньше поправок, чем вариант, который меняет модуль и фазу везде, но лучше сохраняет спектр, низкочастотную межушную фазу и межушные уровни. Профессиональные слушатели тоже предпочли более ограниченную схему.

КорректорВыходов на каналMel DistanceSTFT DistanceОшибка IPD ниже 1,5 кГцОценка инженеров
Полосовой5320,6581,0190,7963 рад0,75
Неограниченный9620,7051,1200,8155 рад0,66

Как это читать: полосовая схема сокращает размер выхода примерно на 45%, однако выигрывает и по объективным показателям, и по прослушиванию. Практический вывод для фазо-зависимых систем состоит не в том, чтобы «предсказывать больше», а в том, чтобы связывать тип поправки с физикой слуха и частотной областью.

Оригинальная статья на arXiv