TSE DOA ASR
Multi-party ASR

PATSE: target speaker extraction по DOA вместо diarization stitching

WER 14.0

PATSE атакует практическую проблему multi-party ASR: нужно получить “кто что сказал”, но diarization, separation и ASR часто склеиваются в хрупкий pipeline. Авторы предлагают diarization-free схему, где target speaker extraction управляется пространственной подсказкой DOA, а активность говорящего выводится после извлечения простым VAD. Главный ход — удерживать идентичность говорящего через позицию, а не пытаться сначала идеально разметить все overlap-сегменты.

Метод. Модель получает многоканальный сигнал и позиционную информацию о целевом говорящем, после чего извлекает его речевой поток для ASR. Это отличается от классической схемы diarization → guided source separation → ASR: PATSE не требует явной diarization-разметки во время inference и не должен решать задачу глобального speaker stitching после chunk-wise separation. Для проверки авторы собрали LibriReplay-DOA: 456 четырёхканальных записей, около 7 часов, две или три персоны, четыре угловые конфигурации 15°, 45°, 90°, 120° и overlap от 0 до 100%.

Результаты. На LibriReplay-DOA общий WER у PATSE после pretraining+finetuning равен 14.0. Это лучше FastMNMF с WER 21.1, Sortformer+GSS с 38.4, CSS TIGER PT+FT с 32.8 и DSB+Gate с 31.5, причём DSB+Gate применим только к non-overlap. На TEIDAN English subset, где около 2.5 часа spontaneous triadic dialogue и overlap 31.98%, PATSE показывает WER 20.50 и DER 13.83; FastMNMF имеет WER 26.82 и DER 28.42, а Sortformer+GSS — WER 45.03 и DER 36.15.

Ограничения. Метод опирается на доступную и достаточно стабильную spatial cue/DOA, поэтому в mono-записи или при сложной геометрии комнаты выгода может исчезнуть. LibriReplay-DOA — полезный controlled benchmark, но это replay-данные, не полный заменитель живых переговорок. Также простая VAD-логика после extraction может быть слабым местом при сильном reverberation, moving speakers или близких углах.

Фишка из статьи. Важна не только средняя победа PATSE, а поведение при сложных углах и overlap. Таблица по LibriReplay-DOA показывает, что pretraining+finetuning особенно помогает, когда говорящие близко расположены и overlap высокий.

СистемаLibriReplay-DOA WER ↓TEIDAN WER ↓TEIDAN DER ↓
FastMNMF21.126.8228.42
Sortformer+GSS38.445.0336.15
CSS TIGER PT+FT32.837.43
PATSE Scratch18.9
PATSE PT+FT14.020.5013.83

Как это читать: spatial conditioning не просто улучшает separation quality, а упрощает весь speaker-attributed ASR pipeline. Это хороший пример, где акустическая постановка задачи снижает требования к отдельному diarization-модулю.

Оригинальная статья на arXiv