улучшение речи звуковые токены адаптивное декодирование
arXiv cs.SD

Grounded Decoding for Autoregressive Speech Enhancement via Adaptive Code-Space Grounding and Local LLM Refinement

arXiv:2609.04245

Авторегрессионный улучшатель речи может звучать естественно и одновременно «додумывать» фонемы. Grounded Decoding удерживает генерацию рядом с наблюдаемым сигналом непосредственно в кодовом пространстве, причём сила ограничения зависит от отношения сигнал/шум.

Метод. Whisper-DPRNN даёт очищенную звуковую подсказку, CosyVoice3 переводит её в факторизованные токены GroupFSQ, а штраф по расстоянию Хэмминга направляет авторегрессионный выбор. Оценка SNR ослабляет штраф на чистом входе и усиливает в шуме. Локальный уточнитель рассматривает соседние коды одним дополнительным проходом с учителем и добавляет около 2,5% вычислений без новых обучаемых параметров.

Результаты. Свободный луч ширины 5 даёт WER 9,0%, P.808 MOS 3,559 и UTMOS 3,754. Адаптивное заземление снижает WER до 8,5%, но UTMOS до 3,633; локальное уточнение возвращает P.808 до 3,546 и UTMOS до 3,684 при том же WER. Авторы обнаруживают, что 82% кодовых искажений лежат в радиусе Хэмминга 2.

Ограничения. Схема привязана к Whisper, CosyVoice3 и геометрии конкретного GroupFSQ. Оценка SNR упрощает реальные смешанные и реверберационные искажения. Улучшение WER невелико, а субъективное качество всё ещё ниже свободной генерации.

Фишка из статьи. Модель действительно меняет силу вмешательства по шуму, а не просто использует один удачный коэффициент.

SNR, дБСредний выбранный штрафИзменено токенов
−51,4940,2%
01,0627,1%
50,5012,6%
100,204,0%
1500%

Как это читать: на чистом сигнале декодер не трогают, а при −5 дБ почти половина решений получает опору на наблюдение. Это делает ограничение содержательно адаптивным и объясняет сохранение слов в тяжёлом шуме.

Оригинальная статья на arXiv