Фазоосознанная обработка Частотно-временной анализ Восстановление звука
arXiv eess.AS

Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior

arXiv:2601.18535

Работа решает узкую, но практически важную задачу: восстанавливает пропавшие столбцы комплексной спектрограммы, не обращаясь ни к обученной нейросети, ни к авторегрессионной модели. Главный ход состоит в том, чтобы продолжать через разрыв не только амплитудные гребни, но и предсказуемое вращение фазы, оценённое по мгновенной частоте. Для коротких повреждений это даёт более высокий SNR, а по воспринимаемому качеству метод выигрывает и на более длинных разрывах.

Метод. U-PHAIN-TF использует STFT с окном Ханна длиной 2048 отсчётов, шагом 512 и перекрытием 75% при частоте 16 кГц. Перед вычислением полной вариации каждый частотный канал поворачивается на фазу, ожидаемую из оценки мгновенной частоты; у устойчивой гармоники после такой коррекции соседние коэффициенты почти постоянны. Обобщённый алгоритм Шамболя-Пока минимизирует временную вариацию скорректированной спектрограммы и одновременно жёстко сохраняет известные коэффициенты. Внешний цикл до десяти раз переоценивает мгновенную частоту по текущему восстановлению, внутренний выполняет 500 прямых и двойственных шагов.

Результаты. Проверены разрывы от одного до шести столбцов, соответствующие затронутым областям примерно 128-288 мс, на восьми фрагментах DPAI и 60 фрагментах IRMAS с инструментами и пением. На коротких разрывах U-PHAIN-TF превосходит Janssen-TF по SNR, на длинных сравнивается с ним, но по ODG стабильно лучше на IRMAS. В MUSHRA-подобном опыте после отсева осталось 17 из 21 слушателя; медианная оценка U-PHAIN-TF была выше DPAI и Janssen-TF, а 95-процентные интервалы медиан не пересекались. Код опубликован.

Ограничения. Это восстановление отсутствующих коэффициентов спектрограммы, а не обычного нулевого участка во временном сигнале: из-за перекрытия окон две постановки неэквивалентны. Наборы малы, состоят главным образом из музыки и пения, а не разговорной речи. В прослушивании использованы только шесть примеров и заранее исключены два сложных фрагмента. Метод остаётся пакетным: даже лучший вариант требует секунд на пятисекундную запись, а сравнение DPAI на GPU с остальными методами на CPU не является аппаратно равным.

Фишка из статьи. Фазовый априорный закон оказался не только качественнее авторегрессии, но и намного дешевле её. Сегментация вокруг каждого разрыва дополнительно почти вдвое ускоряет U-PHAIN-TF без изменения самой целевой функции.

МетодРазрыв 1, сРазрыв 4, сРазрыв 6, сВычислитель
DPAI1140,01140,01140,0Tesla V100S
Janssen-TF123,2202,9205,2Ryzen 9 9900X
U-PHAIN-TF без сегментации10,954,454,1Ryzen 9 9900X
U-PHAIN-TF5,530,534,2Ryzen 9 9900X

Как это читать: для самого длинного разрыва фазоосознанный метод примерно в шесть раз быстрее Janssen-TF, а локальная обработка сокращает его собственное время с 54,1 до 34,2 секунды. Это ещё не реальный масштаб времени, но уже вполне практичная пакетная обработка без обучения на внешнем корпусе.

Оригинальная статья на arXiv