EffVOC: Low-Delay Efficient Speech Waveform Reconstruction from Spectral Representations Without Phase
EffVOC восстанавливает речевую волну только по амплитудному или мел-спектру с алгоритмической задержкой 20 мс. Это практичная фазовая задача: вместо итерационного Griffin-Lim или тяжёлого диффузионного вокодера используется причинная свёрточно-рекуррентная сеть, пригодная для потокового тракта.
Метод. Модель объединяет причинные свёртки и LSTM, а многомасштабные спектральные потери учат одновременно форму волны и согласованность полос. Варианты F64 и F32 регулируют ширину сети; отдельно проверяются амплитудный спектр и более компактный мел-спектр на 16 и 48 кГц.
Результаты. На 16 кГц F64 по амплитуде получает PESQ 4,31 и MOS 4,17 при 27,19 млн параметров и 38,16 GFLOPs. F32 сокращает модель до 7,27 млн и 9,73 GFLOPs, сохраняя MOS 4,17 и PESQ 4,24. Мел-вариант F32 даёт MOS 4,15. На 48 кГц амплитудный F32 достигает PESQ 4,22 и MOS 4,14 при 13,39 GFLOPs.
Ограничения. Обучение и оценка основаны на английском VCTK; время измерено на A100, а не на мобильном процессоре. Миллион шагов обучения и отсутствие проверки после реальных кодеков ограничивают выводы о производственном тракте. Субъективный тест охватывает 160 файлов по восемь слушателей.
Фишка из статьи. Уменьшение ширины вдвое сокращает вычисления почти в четыре раза без измеримой потери MOS.
| Вариант, 16 кГц | Параметры | GFLOPs | PESQ | MOS |
|---|---|---|---|---|
| Амплитуда F64 | 27,19 млн | 38,16 | 4,31 | 4,17 |
| Амплитуда F32 | 7,27 млн | 9,73 | 4,24 | 4,17 |
| Мел-спектр F32 | 6,63 млн | 9,48 | — | 4,15 |
Как это читать: объективная PESQ замечает небольшую потерю, слушатели — нет. Для низкой задержки F32 выглядит более рациональной рабочей точкой, чем максимальная сеть.