H-SAGE: MoE для multi-talker ASR с explicit overlap guidance
H-SAGE интересна как попытка сделать multi-talker ASR не только через permutation handling, но и через явное управление тем, где в сигнале есть overlap и какие эксперты должны его обрабатывать. В отличие от обычного SOT-подхода, модель добавляет speaker-aware global encoder, overlap-aware loss и holistic gating для MoE, чтобы лучше переживать плотные пересечения голосов.
Метод. Базовая линия — serialized output training: несколько говорящих транскрибируются в одну последовательность с разделителями. H-SAGE усиливает ее глобальным speaker-aware encoder и MoE-блоками, где gating учитывает не только локальные признаки, но и целостную информацию о mixture. Overlap-aware loss отдельно подталкивает модель различать зоны с наложением речи, что важно для высоких overlap-ratio сегментов.
Результаты. На LibriSpeechMix-2mix H-SAGE получает test WER 5.7 против 8.3 у SOT и 6.2 у GLAD-SOT; на high-overlap сегментах 2mix WER падает с 12.8 у SOT до 8.2. На zero-shot 3mix сценарии H-SAGE дает test WER 19.5 против 24.2 у SOT и 19.8 у GLAD-SOT. При этом обычный LibriSpeech test-clean/test-other уровень остается близким к сильным baseline: 3.6/3.8.
Ограничения. Основной benchmark синтетический LibriSpeechMix, поэтому реальная meeting acoustics, distant microphones, reverberation и spontaneous speech могут заметно изменить картину. 3-speaker режим проверяется как zero-shot, что полезно, но не заменяет полноценную тренировку на более сложных реальных overlap-паттернах. Статья также не закрывает latency/streaming вопрос.
Фишка из статьи. Выигрыш H-SAGE особенно виден не в среднем WER, а в разрезе overlap ratio: именно там обычные MTASR-системы чаще всего разваливаются.
| Модель | 2mix test WER | 2mix high-overlap WER | 3mix test WER | 3mix high-overlap WER |
|---|---|---|---|---|
| SOT | 8.3 | 12.8 | 24.2 | 32.3 |
| SOT + Local MoLE | 6.5 | 10.3 | 21.7 | 28.5 |
| SOT-SACTC | 6.7 | 10.8 | 20.0 | 27.2 |
| GLAD-SOT | 6.2 | 8.9 | 19.8 | 25.5 |
| H-SAGE | 5.7 | 8.2 | 19.5 | 24.9 |
Как это читать: H-SAGE дает небольшой выигрыш по среднему 3mix WER относительно GLAD-SOT, но более важен устойчивый выигрыш на high-overlap. Для практики это ровно те куски meeting audio, где “средняя” метрика обычно прячет самые болезненные ошибки.