Flow-matching speech separation с biometric best-of-N sampling
Статья решает практическую проблему single-channel speech separation: генеративная flow-matching модель может давать разные plausible separations, но нужно стабильно упорядочить speakers и обрабатывать длинные записи chunk-wise. Авторы добавляют biometric best-of-N sampling: frozen speaker encoder выбирает лучший candidate без ground-truth references и помогает выровнять каналы между chunks. Это делает generative separation ближе к long-form deployment, где permutation ambiguity и chunk drift критичны.
Метод. Модель обучается как conditional flow-matching separator для двух источников; frozen speaker encoder задает ordering при training и используется на inference. Для каждого chunk генерируется N candidates, затем biometric score выбирает тот, где speaker embeddings лучше согласуются с уже принятыми global channels. Chunking использует 1-second chunks с 0.5-second hop, после чего aligned outputs overlap-add собираются в длинную запись.
Результаты. На Libri2Mix clean TUnet получает SI-SDR 17.30 dB, PESQ 3.11 и ESTOI 0.93; на both subset - 11.25 dB, 1.92 и 0.79. SepReformer full сильнее по SI-SDR clean (19.22 dB), но full-utterance режим плохо подходит для длинных записей; SepReformer chunk падает до 11.30 dB и ESTOI 0.88. Downstream evaluation показывает лучший practical result у TUnet: Whisper V3 cpWER 3.84% и Wav2Vec2 speaker-verification EER 0.39%.
Ограничения. Метод ориентирован на two-speaker separation и опирается на frozen speaker encoder; ошибки или bias этого encoder будут влиять на best-of-N selection и channel alignment. Best-of-N увеличивает inference cost пропорционально N, даже если качество насыщается около N=4. Libri2Mix остается controlled benchmark, поэтому реальные overlapping meetings с reverberation, noise и переменным числом speakers потребуют отдельной проверки.
Фишка из статьи. Важная часть - downstream metrics после separation. SI-SDR не всегда отражает, насколько separation полезна для ASR и speaker verification; здесь TUnet выигрывает именно по cpWER/EER, то есть по задачам, которые используют separation дальше.
| Модель | SI-SDR clean | PESQ clean | ESTOI clean | cpWER | EER |
|---|---|---|---|---|---|
| TUnet, ours | 17.30 dB | 3.11 | 0.93 | 3.84% | 0.39% |
| ConvUnet, ours | 14.42 dB | 2.64 | 0.90 | 4.99% | 0.51% |
| SepReformer full | 19.22 dB | 3.02 | 0.92 | 5.02% | 0.72% |
| SepReformer chunk | 11.30 dB | 2.45 | 0.88 | 12.90% | 1.45% |
| MeanFlow-TSE full | 17.56 dB | 3.27 | 0.91 | 9.05% | 2.94% |
Как это читать: SepReformer full лучше по SI-SDR, но TUnet лучше сохраняет downstream recognizability и speaker identity. Biometric selection оптимизирует не только waveform similarity, а полезную speaker-consistent separation.