SSL Reconstruction SUPERB
Speech SSL

OLIVE: speech SSL объединяет masked prediction и waveform reconstruction

PESQ 3.06

OLIVE интересна тем, что пытается совместить два обычно конфликтующих требования к speech SSL: хорошие инвариантные признаки для ASR/speaker/paralinguistics и сохранение сигнальной информации, нужной для waveform reconstruction. Вместо чисто discriminative masked prediction авторы добавляют synthesis branch: ранние encoder features должны быть reconstructable, а поздние contextual representations остаются полезными для downstream анализа. Это делает работу особенно релевантной для систем, где один speech encoder хотят использовать и для распознавания, и для генеративных/реставрационных задач.

Метод

OLIVE использует raw-waveform encoder с 7-layer convolutional frontend, 12-layer Transformer и stride 320 samples, то есть 20 ms при 16 kHz. Analysis objective похож на data2vec-style masked latent prediction: teacher targets формируются усреднением верхних K=8 слоев, student предсказывает их по masked views. Synthesis branch реконструирует waveform через HiFi-GAN-style decoder и заставляет ранние слои не выбрасывать pitch, timbre и fine acoustic detail.

Есть analysis-only варианты OLIVE-A с waveform mixup/gain perturbation и joint OLIVE-J. Final models обучаются 400k updates; analysis-only training занимает 123 часа на 2 H100, joint model — 206 часов.

Результаты

  • На SUPERB generation tasks OLIVE-J получает PESQ 3.10, STOI 95.1, SI-SDRi 12.3, MCD 7.61, VC WER 11.60 и ASV 98.2.
  • OLIVE-A (Mix+Gain) дает лучший SUPERB_s 911, а OLIVE-J — лучший WavLM_s 67.6 и сильные speaker/generation категории.
  • На waveform reconstruction LibriSpeech test-clean frozen feature-conditioned OLIVE-J vocoder дает PESQ 3.06, STOI 0.942, ViSQOL 4.34, SI-SDR 2.94 и UTMOS 3.83.
  • Для сравнения, data2vec 2.0 Base в той же reconstruction таблице дает PESQ 2.21, STOI 0.917, ViSQOL 4.10 и SI-SDR -9.67.

Ограничения

Joint training дороже: 206 часов против 123 для analysis-only variants на 2 H100. Integrated OLIVE-J vocoder уступает frozen feature-conditioned vocoder по точным reconstruction metrics, то есть joint branch еще не полностью оптимизирован. Также SUPERB не гарантирует production performance на noisy conversational ASR, streaming и multilingual speech.

Фишка из статьи. Самое содержательное сравнение — reconstruction table: OLIVE сохраняет в SSL-представлении намного больше waveform detail, не превращаясь в чисто генеративную модель.

Модель reconstructionPESQSTOISI-SDRUTMOS
data2vec 2.0 Base2.210.917-9.673.63
OLIVE-A Mix+Gain2.620.929-3.363.70
OLIVE-J integrated vocoder2.880.9212.503.78
OLIVE-J frozen feat-cond.3.060.9422.943.83

Как это читать: masked SSL обычно учит устойчивые high-level признаки ценой потери fine signal detail. OLIVE показывает, что reconstruction objective можно добавить так, чтобы ранние слои стали полезнее для synthesis/enhancement/VC, а downstream analysis остался конкурентным.

Оригинальная статья на arXiv