распознавание речи перекрывающаяся речь активность говорящих
arXiv cs.SD

Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

arXiv:2609.01287

SPSI добавляет в Whisper не жёсткие границы диаризации, а непрерывную долю активности двух говорящих в каждом кадре. Идея даёт небольшой, но статистически подтверждённый выигрыш на синтетическом перекрытии и гораздо больший выигрыш после аккуратной адаптации к LibriCSS.

Метод. Небольшая головка оценивает двухкомпонентное распределение активности; около равных долей означает перекрытие. Оно изменяет признаки после слоёв 8, 16 и 24 через FiLM и добавляется в декодер четырьмя токенами памяти говорящих. Whisper-medium обучается сериализовать две расшифровки; тракт двухпроходный и не использует внешнее разделение источников при применении.

Результаты. На 1000 смесях LibriSpeech cpWER снижается с 50,7% у SOT до 49,6% (p≈0,006), а при сильном перекрытии — с 60,4% до 58,8%. Нулевая адаптация к LibriCSS практически даёт ничью, 46,6% против 46,7%. Если зафиксировать головку активности и продолжить обучение на примерах с большим перекрытием, cpWER на отложенных сеансах падает до 32,4% против 37,5% у SOT.

Ограничения. Рассматриваются ровно два говорящих и окна LibriCSS, выделенные по истинным временным меткам, а не полные встречи с автоматической сегментацией. Абсолютная ошибка на синтетике остаётся около 50%. Двухпроходное кодирование пока не потоковое, проверена одна основа Whisper-medium, а совместное обновление оценщика активности ухудшает перенос.

Фишка из статьи. «Истинная» активность не становится верхней границей качества, если подменить ею оценённые доли без совместного обучения.

ВариантcpWER, все смесиcpWER, сильное перекрытие
SOT50,7%60,4%
SPSI: FiLM + подсказки декодеру49,6%58,8%
Только FiLM51,7%62,7%
Только подсказки декодеру51,7%61,4%
Жёсткая оценённая маска52,6%63,2%
Подмена на истинные доли при проверке106,8%117,7%

Как это читать: две точки ввода работают только совместно, а жёсткая маска хуже исходной SOT. Катастрофа при подмене на истинные доли показывает несогласованность представлений: более точный боковой сигнал бесполезен, если сеть обучилась на статистике своего шумного оценщика.

Оригинальная статья на arXiv