StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution
StreamWSR восстанавливает полосу речи до 16 кГц прямо во временной области и делает это причинно, без заглядывания вперёд. Главная инженерная идея состоит в очень раннем уменьшении временного разрешения: сеть экономит вычисления там, где большинство отсчётов избыточно, а высокие частоты возвращает остаточным синтезатором.
Метод. Кодировщик с шагом 80 переводит волну в редкую последовательность признаков, причинные блоки обрабатывают её, а декодер предсказывает высокочастотный остаток. Для обучения используются спектральные потери и дискриминаторы в области MDCT. Рассматриваются входы 8, 4 и 2 кГц с единым выходом 16 кГц.
Результаты. Для входа 8 кГц модель получает LSD 0,73 и ViSQOL 4,68, для 4 кГц — 0,92 и 4,27, для 2 кГц — 1,03 и 3,81. Она содержит 9,03 млн параметров и требует 2,12 GFLOPs. На самом тяжёлом режиме 2 кГц WER равен 39,33%, STOI — 87,14%; TRAMBA распознаётся лучше, 33,31%, но не является полностью потоковой схемой с нулевым будущим контекстом.
Ограничения. Опыты ограничены английским VCTK, субъективной оценки и измеренного времени на конечном устройстве нет. Нулевой будущий контекст не означает нулевую системную задержку: буферы ввода-вывода и реализация свёрток отдельно не измерены.
Фишка из статьи. Абляция показывает, что агрессивное уменьшение частоты признаков экономит почти два порядка операций, а основная потеря распознаваемости возникает не из-за него, а из-за замены спектральных дискриминаторов.
| Вариант, вход 2 кГц | LSD | ViSQOL | WER, % | GFLOPs |
|---|---|---|---|---|
| Полная модель | 1,03 | 3,81 | 39,33 | 2,12 |
| Другие дискриминаторы | 1,05 | 3,78 | 43,49 | 2,12 |
| Без раннего шага 80 | 1,07 | 3,69 | 39,46 | 78,4 |
Как это читать: отказ от шага увеличивает вычисления примерно в 37 раз и не улучшает WER. Для потокового восстановления полосы узкое место здесь скорее в обучающем критерии, чем в грубом временном сжатии.