Grounded Decoding for Autoregressive Speech Enhancement via Adaptive Code-Space Grounding and Local LLM Refinement
Авторегрессионный улучшатель речи может звучать естественно и одновременно «додумывать» фонемы. Grounded Decoding удерживает генерацию рядом с наблюдаемым сигналом непосредственно в кодовом пространстве, причём сила ограничения зависит от отношения сигнал/шум.
Метод. Whisper-DPRNN даёт очищенную звуковую подсказку, CosyVoice3 переводит её в факторизованные токены GroupFSQ, а штраф по расстоянию Хэмминга направляет авторегрессионный выбор. Оценка SNR ослабляет штраф на чистом входе и усиливает в шуме. Локальный уточнитель рассматривает соседние коды одним дополнительным проходом с учителем и добавляет около 2,5% вычислений без новых обучаемых параметров.
Результаты. Свободный луч ширины 5 даёт WER 9,0%, P.808 MOS 3,559 и UTMOS 3,754. Адаптивное заземление снижает WER до 8,5%, но UTMOS до 3,633; локальное уточнение возвращает P.808 до 3,546 и UTMOS до 3,684 при том же WER. Авторы обнаруживают, что 82% кодовых искажений лежат в радиусе Хэмминга 2.
Ограничения. Схема привязана к Whisper, CosyVoice3 и геометрии конкретного GroupFSQ. Оценка SNR упрощает реальные смешанные и реверберационные искажения. Улучшение WER невелико, а субъективное качество всё ещё ниже свободной генерации.
Фишка из статьи. Модель действительно меняет силу вмешательства по шуму, а не просто использует один удачный коэффициент.
| SNR, дБ | Средний выбранный штраф | Изменено токенов |
|---|---|---|
| −5 | 1,49 | 40,2% |
| 0 | 1,06 | 27,1% |
| 5 | 0,50 | 12,6% |
| 10 | 0,20 | 4,0% |
| 15 | 0 | 0% |
Как это читать: на чистом сигнале декодер не трогают, а при −5 дБ почти половина решений получает опору на наблюдение. Это делает ограничение содержательно адаптивным и объясняет сохранение слов в тяжёлом шуме.