Source separation Flow matching Speaker embeddings
Speech separation

Flow-matching speech separation с biometric best-of-N sampling

cpWER 3.84%

Статья решает практическую проблему single-channel speech separation: генеративная flow-matching модель может давать разные plausible separations, но нужно стабильно упорядочить speakers и обрабатывать длинные записи chunk-wise. Авторы добавляют biometric best-of-N sampling: frozen speaker encoder выбирает лучший candidate без ground-truth references и помогает выровнять каналы между chunks. Это делает generative separation ближе к long-form deployment, где permutation ambiguity и chunk drift критичны.

Метод. Модель обучается как conditional flow-matching separator для двух источников; frozen speaker encoder задает ordering при training и используется на inference. Для каждого chunk генерируется N candidates, затем biometric score выбирает тот, где speaker embeddings лучше согласуются с уже принятыми global channels. Chunking использует 1-second chunks с 0.5-second hop, после чего aligned outputs overlap-add собираются в длинную запись.

Результаты. На Libri2Mix clean TUnet получает SI-SDR 17.30 dB, PESQ 3.11 и ESTOI 0.93; на both subset - 11.25 dB, 1.92 и 0.79. SepReformer full сильнее по SI-SDR clean (19.22 dB), но full-utterance режим плохо подходит для длинных записей; SepReformer chunk падает до 11.30 dB и ESTOI 0.88. Downstream evaluation показывает лучший practical result у TUnet: Whisper V3 cpWER 3.84% и Wav2Vec2 speaker-verification EER 0.39%.

Ограничения. Метод ориентирован на two-speaker separation и опирается на frozen speaker encoder; ошибки или bias этого encoder будут влиять на best-of-N selection и channel alignment. Best-of-N увеличивает inference cost пропорционально N, даже если качество насыщается около N=4. Libri2Mix остается controlled benchmark, поэтому реальные overlapping meetings с reverberation, noise и переменным числом speakers потребуют отдельной проверки.

Фишка из статьи. Важная часть - downstream metrics после separation. SI-SDR не всегда отражает, насколько separation полезна для ASR и speaker verification; здесь TUnet выигрывает именно по cpWER/EER, то есть по задачам, которые используют separation дальше.

МодельSI-SDR cleanPESQ cleanESTOI cleancpWEREER
TUnet, ours17.30 dB3.110.933.84%0.39%
ConvUnet, ours14.42 dB2.640.904.99%0.51%
SepReformer full19.22 dB3.020.925.02%0.72%
SepReformer chunk11.30 dB2.450.8812.90%1.45%
MeanFlow-TSE full17.56 dB3.270.919.05%2.94%

Как это читать: SepReformer full лучше по SI-SDR, но TUnet лучше сохраняет downstream recognizability и speaker identity. Biometric selection оптимизирует не только waveform similarity, а полезную speaker-consistent separation.

Оригинальная статья на arXiv