восстановление фазы синтез речи малая задержка
arXiv eess.AS

EffVOC: Low-Delay Efficient Speech Waveform Reconstruction from Spectral Representations Without Phase

arXiv:2609.04226

EffVOC восстанавливает речевую волну только по амплитудному или мел-спектру с алгоритмической задержкой 20 мс. Это практичная фазовая задача: вместо итерационного Griffin-Lim или тяжёлого диффузионного вокодера используется причинная свёрточно-рекуррентная сеть, пригодная для потокового тракта.

Метод. Модель объединяет причинные свёртки и LSTM, а многомасштабные спектральные потери учат одновременно форму волны и согласованность полос. Варианты F64 и F32 регулируют ширину сети; отдельно проверяются амплитудный спектр и более компактный мел-спектр на 16 и 48 кГц.

Результаты. На 16 кГц F64 по амплитуде получает PESQ 4,31 и MOS 4,17 при 27,19 млн параметров и 38,16 GFLOPs. F32 сокращает модель до 7,27 млн и 9,73 GFLOPs, сохраняя MOS 4,17 и PESQ 4,24. Мел-вариант F32 даёт MOS 4,15. На 48 кГц амплитудный F32 достигает PESQ 4,22 и MOS 4,14 при 13,39 GFLOPs.

Ограничения. Обучение и оценка основаны на английском VCTK; время измерено на A100, а не на мобильном процессоре. Миллион шагов обучения и отсутствие проверки после реальных кодеков ограничивают выводы о производственном тракте. Субъективный тест охватывает 160 файлов по восемь слушателей.

Фишка из статьи. Уменьшение ширины вдвое сокращает вычисления почти в четыре раза без измеримой потери MOS.

Вариант, 16 кГцПараметрыGFLOPsPESQMOS
Амплитуда F6427,19 млн38,164,314,17
Амплитуда F327,27 млн9,734,244,17
Мел-спектр F326,63 млн9,484,15

Как это читать: объективная PESQ замечает небольшую потерю, слушатели — нет. Для низкой задержки F32 выглядит более рациональной рабочей точкой, чем максимальная сеть.

Оригинальная статья на arXiv