OLIVE: speech SSL объединяет masked prediction и waveform reconstruction
OLIVE интересна тем, что пытается совместить два обычно конфликтующих требования к speech SSL: хорошие инвариантные признаки для ASR/speaker/paralinguistics и сохранение сигнальной информации, нужной для waveform reconstruction. Вместо чисто discriminative masked prediction авторы добавляют synthesis branch: ранние encoder features должны быть reconstructable, а поздние contextual representations остаются полезными для downstream анализа. Это делает работу особенно релевантной для систем, где один speech encoder хотят использовать и для распознавания, и для генеративных/реставрационных задач.
Метод
OLIVE использует raw-waveform encoder с 7-layer convolutional frontend, 12-layer Transformer и stride 320 samples, то есть 20 ms при 16 kHz. Analysis objective похож на data2vec-style masked latent prediction: teacher targets формируются усреднением верхних K=8 слоев, student предсказывает их по masked views. Synthesis branch реконструирует waveform через HiFi-GAN-style decoder и заставляет ранние слои не выбрасывать pitch, timbre и fine acoustic detail.
Есть analysis-only варианты OLIVE-A с waveform mixup/gain perturbation и joint OLIVE-J. Final models обучаются 400k updates; analysis-only training занимает 123 часа на 2 H100, joint model — 206 часов.
Результаты
- На SUPERB generation tasks OLIVE-J получает PESQ 3.10, STOI 95.1, SI-SDRi 12.3, MCD 7.61, VC WER 11.60 и ASV 98.2.
- OLIVE-A (Mix+Gain) дает лучший SUPERB_s 911, а OLIVE-J — лучший WavLM_s 67.6 и сильные speaker/generation категории.
- На waveform reconstruction LibriSpeech test-clean frozen feature-conditioned OLIVE-J vocoder дает PESQ 3.06, STOI 0.942, ViSQOL 4.34, SI-SDR 2.94 и UTMOS 3.83.
- Для сравнения, data2vec 2.0 Base в той же reconstruction таблице дает PESQ 2.21, STOI 0.917, ViSQOL 4.10 и SI-SDR -9.67.
Ограничения
Joint training дороже: 206 часов против 123 для analysis-only variants на 2 H100. Integrated OLIVE-J vocoder уступает frozen feature-conditioned vocoder по точным reconstruction metrics, то есть joint branch еще не полностью оптимизирован. Также SUPERB не гарантирует production performance на noisy conversational ASR, streaming и multilingual speech.
Фишка из статьи. Самое содержательное сравнение — reconstruction table: OLIVE сохраняет в SSL-представлении намного больше waveform detail, не превращаясь в чисто генеративную модель.
| Модель reconstruction | PESQ | STOI | SI-SDR | UTMOS |
|---|---|---|---|---|
| data2vec 2.0 Base | 2.21 | 0.917 | -9.67 | 3.63 |
| OLIVE-A Mix+Gain | 2.62 | 0.929 | -3.36 | 3.70 |
| OLIVE-J integrated vocoder | 2.88 | 0.921 | 2.50 | 3.78 |
| OLIVE-J frozen feat-cond. | 3.06 | 0.942 | 2.94 | 3.83 |
Как это читать: masked SSL обычно учит устойчивые high-level признаки ценой потери fine signal detail. OLIVE показывает, что reconstruction objective можно добавить так, чтобы ранние слои стали полезнее для synthesis/enhancement/VC, а downstream analysis остался конкурентным.