BWE Flow matching DNSMOS
Speech restoration

VeRe-Flow: bandwidth expansion под шумом через clean-guided flow matching

MOS 4.14

VeRe-Flow занимается bandwidth expansion в более реалистичном режиме: вход — не просто узкополосная речь, а noisy low-resolution speech, из которой нужно восстановить чистую широкополосную 16 kHz речь. Интерес статьи в том, что flow matching направляют не только к целевой clean-речи, но и явно отталкивают от noisy-траекторий через velocity contrastive regularization, а также выравнивают представления с clean SSL-признаками.

Метод. Базовая идея похожа на условную генерацию высокочастотной части речи, но авторы меняют обучение flow matching. VeCoR заставляет velocity field быть ближе к clean trajectory и дальше от noisy trajectory, чтобы модель не переносила шум вместе с восстановленными частотами. Второй компонент — representation alignment: сгенерированная речь должна быть согласована с clean self-supervised speech representation, причём в ablation авторы сравнивают XEUS, WavLM и Wav2Vec2. В результате модель остаётся малошаговой: основной режим использует Euler sampling с NFE=2.

Результаты. На noisy test set Valentini-Botinhao, downsampled до 8 kHz, предложенная модель при NFE=2 показывает LSD 1.10, DNSMOS SIG 3.43, BAK 3.97, OVRL 3.12 и subjective MOS 4.14 ± 0.65. Для сравнения, FLowHigh при том же NFE=2 получает LSD 1.12, OVRL 3.07 и MOS 4.03 ± 0.75, а NU-Wave2 с NFE=48 — LSD 1.35, OVRL 2.98 и MOS 3.76 ± 0.72. Ground truth в этом протоколе имеет MOS 4.30 ± 0.46, то есть разрыв по субъективной оценке остаётся, но уже не выглядит огромным.

Ограничения. Это всё ещё bandwidth expansion на конкретном noisy benchmark, а не универсальный enhancement для всех каналов, микрофонов и языков. Субъективная оценка дана, но масштаб и разнообразие прослушивания ограничены. Кроме того, улучшения по DNSMOS и LSD небольшие относительно сильного baseline, поэтому практический выигрыш стоит проверять в downstream ASR или voice-call сценариях, где шум и кодек могут отличаться от Valentini-Botinhao.

Фишка из статьи. Самая полезная инженерная деталь — сравнение SSL-представлений для alignment. Оно показывает, что “добавить SSL loss” недостаточно: выбор представления заметно меняет баланс spectral distortion и noise quality.

SSL representationLSD ↓SIG ↑BAK ↑OVRL ↑
XEUS1.103.433.973.12
WavLM1.153.423.943.10
Wav2Vec21.473.413.282.77

Как это читать: XEUS даёт не просто чуть лучший LSD, а заметно удерживает BAK/OVRL, тогда как Wav2Vec2 в этом протоколе сильнее портит фон. Для noisy bandwidth expansion это важнее, чем среднее улучшение одной метрики.

Оригинальная статья на arXiv