Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec
Авторы сводят шесть вариантов генеративного улучшения речи к одному устройству и сравнивают их на одинаковых данных: дискретные и непрерывные, авторегрессионные и параллельные, диффузию и согласование потоков. Это полезная работа против разрозненных таблиц: при едином кодеке непрерывные признаки стабильно выигрывают у кодовых индексов, а лучший вариант оказывается непрерывным неавторегрессионным преобразователем.
Метод. Все модели используют замороженные DAC и WavLM, а обучаемая часть - 24-слойная Llama или непричинный преобразователь на 205-278 млн параметров. DAC выдает 1 024-мерные непрерывные признаки и 12 дискретных кодовых книг. Шесть постановок обучаются на 1 202,2 часа URGENT 2025 с шумом, реверберацией, клиппингом, потерями кодека и пакетов и ветром. Дополнительная донастройка добавляет к основной потере дифференцируемые L1, PESQ и STOI по восстановленной волне.
Результаты. На тесте шумный сигнал имеет PESQ 1,31 и POLQA 1,85. Лучший базовый CNAR дает 1,99/2,75, а после донастройки - 2,41/3,00; DNSMOS при этом равен 3,03, NISQA 3,41, ESTOI 0,76. Лучший вариант согласования потоков после донастройки получает PESQ 2,15 и NISQA 3,53. Среди дискретных методов даже лучший DDiff-FT ограничивается PESQ 1,81 и POLQA 2,36. Для диффузии и согласования потоков уже три шага дают почти максимум.
Ограничения. После предварительной абляции все шесть методов сравниваются только с одним кодеком DAC; вывод может измениться для других латентных пространств. Размеры моделей различаются, хотя общий каркас совпадает. Данные синтетически искажены, человеческого прослушивания нет, задержка и RTF не приведены. Даже лучший CNAR-FT далек от верхней границы самого кодека: DAC-перекодирование чистой речи имеет PESQ 3,85 и POLQA 4,24.
Фишка из статьи. Неинтрузивные оценки выглядят почти как у чистой речи, тогда как метрики с эталоном обнаруживают большой остаточный разрыв. Это предупреждение против вывода о качестве по одному DNSMOS.
| Метод | DNSMOS | NISQA | PESQ | POLQA | ESTOI |
|---|---|---|---|---|---|
| Шумный сигнал | 1,84 | 1,65 | 1,31 | 1,85 | 0,61 |
| DDiff-FT, дискретная диффузия | 2,80 | 3,01 | 1,81 | 2,36 | 0,67 |
| CFM-FT, непрерывный поток | 2,96 | 3,53 | 2,15 | 2,76 | 0,73 |
| CNAR-FT, непрерывный параллельный | 3,03 | 3,41 | 2,41 | 3,00 | 0,76 |
| Чистая речь через DAC | 2,99 | 3,39 | 3,85 | 4,24 | 0,93 |
Как это читать: по DNSMOS CNAR-FT даже слегка превосходит чистую речь после DAC, но PESQ остается на 1,44 пункта ниже. Согласованность неинтрузивных и эталонных метрик здесь слабая, поэтому утверждение о почти чистом качестве было бы преждевременным.