Вокодер Фаза STFT
Нейровокодеры

Vocos и phasiness: проблема не в magnitude, а в фазе

LSC -29.56 dB

Статья разбирает практическую причину характерной "phasiness" у нейровокодера Vocos: модель хорошо восстанавливает амплитудную часть спектра, но хуже держит фазовую структуру. Это полезная работа для тех, кто делает синтез речи или улучшение речи через частотно-временное представление, потому что авторы не просто сравнивают вокодеры, а изолируют ошибку фазы. Главный вывод: одномерный ConvNeXt-блок удобен для magnitude, но плохо подходит для локальной двумерной геометрии фазы во времени и частоте.

Метод. Авторы переобучают и модифицируют Vocos на 80-band log-mel признаках, 22.05 кГц и диапазоне 0-8 кГц, а затем проводят раздельный анализ magnitude и phase. Они показывают, что дефолтное ограничение magnitude в Vocos слишком низкое: порог 100 не покрывает до 41% обучающих примеров, поэтому его повышают до 400. После этого проверяют два оракула: модель с правильной фазой и предсказанной амплитудой, а также модель с правильной амплитудой и предсказанной фазой.

Результаты. На LibriTTS и немецких тестовых фразах BigVGANv2 остается сильнее Vocos в субъективном MUSHRA-тесте, но главное измерение находится в разборе ошибки. Vocos-Mag с оракульной фазой получает LSC -29.18/-31.04 дБ и V/UV F1 0.987/0.987, тогда как Vocos-Phase с оракульной амплитудой падает до LSC -10.39/-11.20 дБ и V/UV F1 0.921/0.901. То есть критическая деградация приходит именно из фазового канала.

Ограничения. Работа не предлагает полностью готовую замену Vocos: двумерные свертки резко улучшают локальное предсказание фазы, но прямой двумерный вокодер все еще плохо справляется с гармонической структурой по широкому частотному диапазону. Кроме того, субъективная часть небольшая: 16 участников оценивали 14 из 20 немецких примеров.

Фишка из статьи. Самый сильный фрагмент - короткий опыт с фазовой разностью. Он показывает, что маленькая двумерная модель для phase difference намного точнее большой одномерной, хотя почти не имеет параметров по сравнению с ней.

BackboneПараметрыFLOPs/sLwaLSC
Conv1D Vocos15.0M3.0B0.646-20.24 дБ
Conv2D37.1K3.5B0.112-29.56 дБ

Как это читать: фаза в STFT живет в двумерной окрестности времени и частоты. Увеличение числа параметров в одномерной временной модели не заменяет правильную индуктивную предпосылку, поэтому маленькая Conv2D-сеть дает гораздо лучший LSC.

Оригинальная статья на arXiv