VeRe-Flow: bandwidth expansion под шумом через clean-guided flow matching
VeRe-Flow занимается bandwidth expansion в более реалистичном режиме: вход — не просто узкополосная речь, а noisy low-resolution speech, из которой нужно восстановить чистую широкополосную 16 kHz речь. Интерес статьи в том, что flow matching направляют не только к целевой clean-речи, но и явно отталкивают от noisy-траекторий через velocity contrastive regularization, а также выравнивают представления с clean SSL-признаками.
Метод. Базовая идея похожа на условную генерацию высокочастотной части речи, но авторы меняют обучение flow matching. VeCoR заставляет velocity field быть ближе к clean trajectory и дальше от noisy trajectory, чтобы модель не переносила шум вместе с восстановленными частотами. Второй компонент — representation alignment: сгенерированная речь должна быть согласована с clean self-supervised speech representation, причём в ablation авторы сравнивают XEUS, WavLM и Wav2Vec2. В результате модель остаётся малошаговой: основной режим использует Euler sampling с NFE=2.
Результаты. На noisy test set Valentini-Botinhao, downsampled до 8 kHz, предложенная модель при NFE=2 показывает LSD 1.10, DNSMOS SIG 3.43, BAK 3.97, OVRL 3.12 и subjective MOS 4.14 ± 0.65. Для сравнения, FLowHigh при том же NFE=2 получает LSD 1.12, OVRL 3.07 и MOS 4.03 ± 0.75, а NU-Wave2 с NFE=48 — LSD 1.35, OVRL 2.98 и MOS 3.76 ± 0.72. Ground truth в этом протоколе имеет MOS 4.30 ± 0.46, то есть разрыв по субъективной оценке остаётся, но уже не выглядит огромным.
Ограничения. Это всё ещё bandwidth expansion на конкретном noisy benchmark, а не универсальный enhancement для всех каналов, микрофонов и языков. Субъективная оценка дана, но масштаб и разнообразие прослушивания ограничены. Кроме того, улучшения по DNSMOS и LSD небольшие относительно сильного baseline, поэтому практический выигрыш стоит проверять в downstream ASR или voice-call сценариях, где шум и кодек могут отличаться от Valentini-Botinhao.
Фишка из статьи. Самая полезная инженерная деталь — сравнение SSL-представлений для alignment. Оно показывает, что “добавить SSL loss” недостаточно: выбор представления заметно меняет баланс spectral distortion и noise quality.
| SSL representation | LSD ↓ | SIG ↑ | BAK ↑ | OVRL ↑ |
|---|---|---|---|---|
| XEUS | 1.10 | 3.43 | 3.97 | 3.12 |
| WavLM | 1.15 | 3.42 | 3.94 | 3.10 |
| Wav2Vec2 | 1.47 | 3.41 | 3.28 | 2.77 |
Как это читать: XEUS даёт не просто чуть лучший LSD, а заметно удерживает BAK/OVRL, тогда как Wav2Vec2 в этом протоколе сильнее портит фон. Для noisy bandwidth expansion это важнее, чем среднее улучшение одной метрики.