сверхразрешение речи потоковая обработка восстановление сигнала
arXiv eess.AS

StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution

arXiv:2609.03381

StreamWSR восстанавливает полосу речи до 16 кГц прямо во временной области и делает это причинно, без заглядывания вперёд. Главная инженерная идея состоит в очень раннем уменьшении временного разрешения: сеть экономит вычисления там, где большинство отсчётов избыточно, а высокие частоты возвращает остаточным синтезатором.

Метод. Кодировщик с шагом 80 переводит волну в редкую последовательность признаков, причинные блоки обрабатывают её, а декодер предсказывает высокочастотный остаток. Для обучения используются спектральные потери и дискриминаторы в области MDCT. Рассматриваются входы 8, 4 и 2 кГц с единым выходом 16 кГц.

Результаты. Для входа 8 кГц модель получает LSD 0,73 и ViSQOL 4,68, для 4 кГц — 0,92 и 4,27, для 2 кГц — 1,03 и 3,81. Она содержит 9,03 млн параметров и требует 2,12 GFLOPs. На самом тяжёлом режиме 2 кГц WER равен 39,33%, STOI — 87,14%; TRAMBA распознаётся лучше, 33,31%, но не является полностью потоковой схемой с нулевым будущим контекстом.

Ограничения. Опыты ограничены английским VCTK, субъективной оценки и измеренного времени на конечном устройстве нет. Нулевой будущий контекст не означает нулевую системную задержку: буферы ввода-вывода и реализация свёрток отдельно не измерены.

Фишка из статьи. Абляция показывает, что агрессивное уменьшение частоты признаков экономит почти два порядка операций, а основная потеря распознаваемости возникает не из-за него, а из-за замены спектральных дискриминаторов.

Вариант, вход 2 кГцLSDViSQOLWER, %GFLOPs
Полная модель1,033,8139,332,12
Другие дискриминаторы1,053,7843,492,12
Без раннего шага 801,073,6939,4678,4

Как это читать: отказ от шага увеличивает вычисления примерно в 37 раз и не улучшает WER. Для потокового восстановления полосы узкое место здесь скорее в обучающем критерии, чем в грубом временном сжатии.

Оригинальная статья на arXiv