Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations
MARSE пытается занять середину между быстрым параллельным улучшением речи и дорогой полной авторегрессией. Модель восстанавливает непрерывные представления кодека блоками под маской и может тратить больше шагов только там, где это оправдывает качество.
Метод. Зашумлённая речь кодируется в непрерывную последовательность, после чего причинный маскированный преобразователь итеративно уточняет скрытые блоки. Число проходов N задаёт обмен между скоростью и качеством. В отличие от дискретных токенов здесь не возникает отдельной ошибки квантования на этапе улучшения.
Результаты. На Libri1Mix причинный MARSE получает DNSMOS OVRL 3,34 и dWER 12,68% при 1912 GFLOPs; параллельный C-NAR даёт 3,32 и 12,84% при 1235 GFLOPs, а полная авторегрессия — 3,37 и 20,89% при 3856 GFLOPs. На LibriDEMAND MARSE достигает OVRL 3,11 и dWER 9,35%, немного лучше C-NAR 3,08 и 9,61%.
Ограничения. Даже промежуточный режим остаётся очень тяжёлым, а практического измерения задержки и памяти нет. Лучший вариант выбора числа шагов использует «оракульскую» уверенность. После примерно 20–40 шагов прирост OVRL почти прекращается, поэтому максимальная авторегрессия плохо окупается.
Фишка из статьи. Полная авторегрессия улучшает воспринимаемое качество, но одновременно сильнее портит распознаваемость.
| Модель, Libri1Mix | OVRL | dWER, % | GFLOPs |
|---|---|---|---|
| C-NAR | 3,32 | 12,84 | 1235 |
| MARSE, причинный | 3,34 | 12,68 | 1912 |
| C-AR | 3,37 | 20,89 | 3856 |
Как это читать: последние 0,03 пункта OVRL у C-AR стоят удвоения вычислений и резкого роста ошибок слов. Блочная маскированная схема разумнее, если сохранение содержания важнее малого прироста субъективной чистоты.