Soft Posterior Speaker Injection for Multi-Talker Speech Recognition
SPSI добавляет в Whisper не жёсткие границы диаризации, а непрерывную долю активности двух говорящих в каждом кадре. Идея даёт небольшой, но статистически подтверждённый выигрыш на синтетическом перекрытии и гораздо больший выигрыш после аккуратной адаптации к LibriCSS.
Метод. Небольшая головка оценивает двухкомпонентное распределение активности; около равных долей означает перекрытие. Оно изменяет признаки после слоёв 8, 16 и 24 через FiLM и добавляется в декодер четырьмя токенами памяти говорящих. Whisper-medium обучается сериализовать две расшифровки; тракт двухпроходный и не использует внешнее разделение источников при применении.
Результаты. На 1000 смесях LibriSpeech cpWER снижается с 50,7% у SOT до 49,6% (p≈0,006), а при сильном перекрытии — с 60,4% до 58,8%. Нулевая адаптация к LibriCSS практически даёт ничью, 46,6% против 46,7%. Если зафиксировать головку активности и продолжить обучение на примерах с большим перекрытием, cpWER на отложенных сеансах падает до 32,4% против 37,5% у SOT.
Ограничения. Рассматриваются ровно два говорящих и окна LibriCSS, выделенные по истинным временным меткам, а не полные встречи с автоматической сегментацией. Абсолютная ошибка на синтетике остаётся около 50%. Двухпроходное кодирование пока не потоковое, проверена одна основа Whisper-medium, а совместное обновление оценщика активности ухудшает перенос.
Фишка из статьи. «Истинная» активность не становится верхней границей качества, если подменить ею оценённые доли без совместного обучения.
| Вариант | cpWER, все смеси | cpWER, сильное перекрытие |
|---|---|---|
| SOT | 50,7% | 60,4% |
| SPSI: FiLM + подсказки декодеру | 49,6% | 58,8% |
| Только FiLM | 51,7% | 62,7% |
| Только подсказки декодеру | 51,7% | 61,4% |
| Жёсткая оценённая маска | 52,6% | 63,2% |
| Подмена на истинные доли при проверке | 106,8% | 117,7% |
Как это читать: две точки ввода работают только совместно, а жёсткая маска хуже исходной SOT. Катастрофа при подмене на истинные доли показывает несогласованность представлений: более точный боковой сигнал бесполезен, если сеть обучилась на статистике своего шумного оценщика.