Vocos и phasiness: проблема не в magnitude, а в фазе
Статья разбирает практическую причину характерной "phasiness" у нейровокодера Vocos: модель хорошо восстанавливает амплитудную часть спектра, но хуже держит фазовую структуру. Это полезная работа для тех, кто делает синтез речи или улучшение речи через частотно-временное представление, потому что авторы не просто сравнивают вокодеры, а изолируют ошибку фазы. Главный вывод: одномерный ConvNeXt-блок удобен для magnitude, но плохо подходит для локальной двумерной геометрии фазы во времени и частоте.
Метод. Авторы переобучают и модифицируют Vocos на 80-band log-mel признаках, 22.05 кГц и диапазоне 0-8 кГц, а затем проводят раздельный анализ magnitude и phase. Они показывают, что дефолтное ограничение magnitude в Vocos слишком низкое: порог 100 не покрывает до 41% обучающих примеров, поэтому его повышают до 400. После этого проверяют два оракула: модель с правильной фазой и предсказанной амплитудой, а также модель с правильной амплитудой и предсказанной фазой.
Результаты. На LibriTTS и немецких тестовых фразах BigVGANv2 остается сильнее Vocos в субъективном MUSHRA-тесте, но главное измерение находится в разборе ошибки. Vocos-Mag с оракульной фазой получает LSC -29.18/-31.04 дБ и V/UV F1 0.987/0.987, тогда как Vocos-Phase с оракульной амплитудой падает до LSC -10.39/-11.20 дБ и V/UV F1 0.921/0.901. То есть критическая деградация приходит именно из фазового канала.
Ограничения. Работа не предлагает полностью готовую замену Vocos: двумерные свертки резко улучшают локальное предсказание фазы, но прямой двумерный вокодер все еще плохо справляется с гармонической структурой по широкому частотному диапазону. Кроме того, субъективная часть небольшая: 16 участников оценивали 14 из 20 немецких примеров.
Фишка из статьи. Самый сильный фрагмент - короткий опыт с фазовой разностью. Он показывает, что маленькая двумерная модель для phase difference намного точнее большой одномерной, хотя почти не имеет параметров по сравнению с ней.
| Backbone | Параметры | FLOPs/s | Lwa | LSC |
|---|---|---|---|---|
| Conv1D Vocos | 15.0M | 3.0B | 0.646 | -20.24 дБ |
| Conv2D | 37.1K | 3.5B | 0.112 | -29.56 дБ |
Как это читать: фаза в STFT живет в двумерной окрестности времени и частоты. Увеличение числа параметров в одномерной временной модели не заменяет правильную индуктивную предпосылку, поэтому маленькая Conv2D-сеть дает гораздо лучший LSC.