Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior
Работа решает узкую, но практически важную задачу: восстанавливает пропавшие столбцы комплексной спектрограммы, не обращаясь ни к обученной нейросети, ни к авторегрессионной модели. Главный ход состоит в том, чтобы продолжать через разрыв не только амплитудные гребни, но и предсказуемое вращение фазы, оценённое по мгновенной частоте. Для коротких повреждений это даёт более высокий SNR, а по воспринимаемому качеству метод выигрывает и на более длинных разрывах.
Метод. U-PHAIN-TF использует STFT с окном Ханна длиной 2048 отсчётов, шагом 512 и перекрытием 75% при частоте 16 кГц. Перед вычислением полной вариации каждый частотный канал поворачивается на фазу, ожидаемую из оценки мгновенной частоты; у устойчивой гармоники после такой коррекции соседние коэффициенты почти постоянны. Обобщённый алгоритм Шамболя-Пока минимизирует временную вариацию скорректированной спектрограммы и одновременно жёстко сохраняет известные коэффициенты. Внешний цикл до десяти раз переоценивает мгновенную частоту по текущему восстановлению, внутренний выполняет 500 прямых и двойственных шагов.
Результаты. Проверены разрывы от одного до шести столбцов, соответствующие затронутым областям примерно 128-288 мс, на восьми фрагментах DPAI и 60 фрагментах IRMAS с инструментами и пением. На коротких разрывах U-PHAIN-TF превосходит Janssen-TF по SNR, на длинных сравнивается с ним, но по ODG стабильно лучше на IRMAS. В MUSHRA-подобном опыте после отсева осталось 17 из 21 слушателя; медианная оценка U-PHAIN-TF была выше DPAI и Janssen-TF, а 95-процентные интервалы медиан не пересекались. Код опубликован.
Ограничения. Это восстановление отсутствующих коэффициентов спектрограммы, а не обычного нулевого участка во временном сигнале: из-за перекрытия окон две постановки неэквивалентны. Наборы малы, состоят главным образом из музыки и пения, а не разговорной речи. В прослушивании использованы только шесть примеров и заранее исключены два сложных фрагмента. Метод остаётся пакетным: даже лучший вариант требует секунд на пятисекундную запись, а сравнение DPAI на GPU с остальными методами на CPU не является аппаратно равным.
Фишка из статьи. Фазовый априорный закон оказался не только качественнее авторегрессии, но и намного дешевле её. Сегментация вокруг каждого разрыва дополнительно почти вдвое ускоряет U-PHAIN-TF без изменения самой целевой функции.
| Метод | Разрыв 1, с | Разрыв 4, с | Разрыв 6, с | Вычислитель |
|---|---|---|---|---|
| DPAI | 1140,0 | 1140,0 | 1140,0 | Tesla V100S |
| Janssen-TF | 123,2 | 202,9 | 205,2 | Ryzen 9 9900X |
| U-PHAIN-TF без сегментации | 10,9 | 54,4 | 54,1 | Ryzen 9 9900X |
| U-PHAIN-TF | 5,5 | 30,5 | 34,2 | Ryzen 9 9900X |
Как это читать: для самого длинного разрыва фазоосознанный метод примерно в шесть раз быстрее Janssen-TF, а локальная обработка сокращает его собственное время с 54,1 до 34,2 секунды. Это ещё не реальный масштаб времени, но уже вполне практичная пакетная обработка без обучения на внешнем корпусе.