MTASR MoE Overlap
Multi-talker ASR

H-SAGE: MoE для multi-talker ASR с explicit overlap guidance

WER 5.7

H-SAGE интересна как попытка сделать multi-talker ASR не только через permutation handling, но и через явное управление тем, где в сигнале есть overlap и какие эксперты должны его обрабатывать. В отличие от обычного SOT-подхода, модель добавляет speaker-aware global encoder, overlap-aware loss и holistic gating для MoE, чтобы лучше переживать плотные пересечения голосов.

Метод. Базовая линия — serialized output training: несколько говорящих транскрибируются в одну последовательность с разделителями. H-SAGE усиливает ее глобальным speaker-aware encoder и MoE-блоками, где gating учитывает не только локальные признаки, но и целостную информацию о mixture. Overlap-aware loss отдельно подталкивает модель различать зоны с наложением речи, что важно для высоких overlap-ratio сегментов.

Результаты. На LibriSpeechMix-2mix H-SAGE получает test WER 5.7 против 8.3 у SOT и 6.2 у GLAD-SOT; на high-overlap сегментах 2mix WER падает с 12.8 у SOT до 8.2. На zero-shot 3mix сценарии H-SAGE дает test WER 19.5 против 24.2 у SOT и 19.8 у GLAD-SOT. При этом обычный LibriSpeech test-clean/test-other уровень остается близким к сильным baseline: 3.6/3.8.

Ограничения. Основной benchmark синтетический LibriSpeechMix, поэтому реальная meeting acoustics, distant microphones, reverberation и spontaneous speech могут заметно изменить картину. 3-speaker режим проверяется как zero-shot, что полезно, но не заменяет полноценную тренировку на более сложных реальных overlap-паттернах. Статья также не закрывает latency/streaming вопрос.

Фишка из статьи. Выигрыш H-SAGE особенно виден не в среднем WER, а в разрезе overlap ratio: именно там обычные MTASR-системы чаще всего разваливаются.

Модель2mix test WER2mix high-overlap WER3mix test WER3mix high-overlap WER
SOT8.312.824.232.3
SOT + Local MoLE6.510.321.728.5
SOT-SACTC6.710.820.027.2
GLAD-SOT6.28.919.825.5
H-SAGE5.78.219.524.9

Как это читать: H-SAGE дает небольшой выигрыш по среднему 3mix WER относительно GLAD-SOT, но более важен устойчивый выигрыш на high-overlap. Для практики это ровно те куски meeting audio, где “средняя” метрика обычно прячет самые болезненные ошибки.

Оригинальная статья на arXiv