PATSE: target speaker extraction по DOA вместо diarization stitching
PATSE атакует практическую проблему multi-party ASR: нужно получить “кто что сказал”, но diarization, separation и ASR часто склеиваются в хрупкий pipeline. Авторы предлагают diarization-free схему, где target speaker extraction управляется пространственной подсказкой DOA, а активность говорящего выводится после извлечения простым VAD. Главный ход — удерживать идентичность говорящего через позицию, а не пытаться сначала идеально разметить все overlap-сегменты.
Метод. Модель получает многоканальный сигнал и позиционную информацию о целевом говорящем, после чего извлекает его речевой поток для ASR. Это отличается от классической схемы diarization → guided source separation → ASR: PATSE не требует явной diarization-разметки во время inference и не должен решать задачу глобального speaker stitching после chunk-wise separation. Для проверки авторы собрали LibriReplay-DOA: 456 четырёхканальных записей, около 7 часов, две или три персоны, четыре угловые конфигурации 15°, 45°, 90°, 120° и overlap от 0 до 100%.
Результаты. На LibriReplay-DOA общий WER у PATSE после pretraining+finetuning равен 14.0. Это лучше FastMNMF с WER 21.1, Sortformer+GSS с 38.4, CSS TIGER PT+FT с 32.8 и DSB+Gate с 31.5, причём DSB+Gate применим только к non-overlap. На TEIDAN English subset, где около 2.5 часа spontaneous triadic dialogue и overlap 31.98%, PATSE показывает WER 20.50 и DER 13.83; FastMNMF имеет WER 26.82 и DER 28.42, а Sortformer+GSS — WER 45.03 и DER 36.15.
Ограничения. Метод опирается на доступную и достаточно стабильную spatial cue/DOA, поэтому в mono-записи или при сложной геометрии комнаты выгода может исчезнуть. LibriReplay-DOA — полезный controlled benchmark, но это replay-данные, не полный заменитель живых переговорок. Также простая VAD-логика после extraction может быть слабым местом при сильном reverberation, moving speakers или близких углах.
Фишка из статьи. Важна не только средняя победа PATSE, а поведение при сложных углах и overlap. Таблица по LibriReplay-DOA показывает, что pretraining+finetuning особенно помогает, когда говорящие близко расположены и overlap высокий.
| Система | LibriReplay-DOA WER ↓ | TEIDAN WER ↓ | TEIDAN DER ↓ |
|---|---|---|---|
| FastMNMF | 21.1 | 26.82 | 28.42 |
| Sortformer+GSS | 38.4 | 45.03 | 36.15 |
| CSS TIGER PT+FT | 32.8 | 37.43 | — |
| PATSE Scratch | 18.9 | — | — |
| PATSE PT+FT | 14.0 | 20.50 | 13.83 |
Как это читать: spatial conditioning не просто улучшает separation quality, а упрощает весь speaker-attributed ASR pipeline. Это хороший пример, где акустическая постановка задачи снижает требования к отдельному diarization-модулю.