Улучшение речи Нейронные кодеки Сравнение методов
arXiv eess.AS

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

arXiv:2608.12082

Авторы сводят шесть вариантов генеративного улучшения речи к одному устройству и сравнивают их на одинаковых данных: дискретные и непрерывные, авторегрессионные и параллельные, диффузию и согласование потоков. Это полезная работа против разрозненных таблиц: при едином кодеке непрерывные признаки стабильно выигрывают у кодовых индексов, а лучший вариант оказывается непрерывным неавторегрессионным преобразователем.

Метод. Все модели используют замороженные DAC и WavLM, а обучаемая часть - 24-слойная Llama или непричинный преобразователь на 205-278 млн параметров. DAC выдает 1 024-мерные непрерывные признаки и 12 дискретных кодовых книг. Шесть постановок обучаются на 1 202,2 часа URGENT 2025 с шумом, реверберацией, клиппингом, потерями кодека и пакетов и ветром. Дополнительная донастройка добавляет к основной потере дифференцируемые L1, PESQ и STOI по восстановленной волне.

Результаты. На тесте шумный сигнал имеет PESQ 1,31 и POLQA 1,85. Лучший базовый CNAR дает 1,99/2,75, а после донастройки - 2,41/3,00; DNSMOS при этом равен 3,03, NISQA 3,41, ESTOI 0,76. Лучший вариант согласования потоков после донастройки получает PESQ 2,15 и NISQA 3,53. Среди дискретных методов даже лучший DDiff-FT ограничивается PESQ 1,81 и POLQA 2,36. Для диффузии и согласования потоков уже три шага дают почти максимум.

Ограничения. После предварительной абляции все шесть методов сравниваются только с одним кодеком DAC; вывод может измениться для других латентных пространств. Размеры моделей различаются, хотя общий каркас совпадает. Данные синтетически искажены, человеческого прослушивания нет, задержка и RTF не приведены. Даже лучший CNAR-FT далек от верхней границы самого кодека: DAC-перекодирование чистой речи имеет PESQ 3,85 и POLQA 4,24.

Фишка из статьи. Неинтрузивные оценки выглядят почти как у чистой речи, тогда как метрики с эталоном обнаруживают большой остаточный разрыв. Это предупреждение против вывода о качестве по одному DNSMOS.

МетодDNSMOSNISQAPESQPOLQAESTOI
Шумный сигнал1,841,651,311,850,61
DDiff-FT, дискретная диффузия2,803,011,812,360,67
CFM-FT, непрерывный поток2,963,532,152,760,73
CNAR-FT, непрерывный параллельный3,033,412,413,000,76
Чистая речь через DAC2,993,393,854,240,93

Как это читать: по DNSMOS CNAR-FT даже слегка превосходит чистую речь после DAC, но PESQ остается на 1,44 пункта ниже. Согласованность неинтрузивных и эталонных метрик здесь слабая, поэтому утверждение о почти чистом качестве было бы преждевременным.

Оригинальная статья на arXiv