ASR Speech LLM Interleaving
Speech LLM / ASR

JSTIP: interleaved speech-text training для ASR с сохранением LLM-prior

EER 6.60

JSTIP интересна тем, что разбирает слабое место speech-LLM интеграции для ASR: после большого supervised ASR fine-tuning текстовый prior LLM часто остается “рядом”, но плохо переносится в speech-conditioned режим. Авторы предлагают Joint Speech-Text Interleaved Pretraining: внутри aligned speech-text pairs они строят word-level, segment-level и mixed interleaved sequences, чтобы модель училась переключаться между аудио и текстом в одном autoregressive контексте.

Метод. Вместо простого смешивания ASR и text batches JSTIP вставляет текстовые сегменты в speech sequence по alignment: границы можно задавать по silence, punctuation или их комбинации. Это должно уменьшить modality gap: модель не только транскрибирует speech tokens, но и продолжает next-token prediction в текстовой форме. Проверка идет на 38k часов ASR data, entity-rich medical/banking тестах, MMLU/SQA diagnostics и domain adaptation через PubMed или synthetic TTS pairs.

Результаты. ASR-only baseline имеет Medical-AVG EER 7.97 и MMLU-S2T 35.68; добавление interleaving снижает EER до 7.32 и поднимает MMLU-S2T до 51.77. ASR+PubMed без interleaving улучшает MMLU-T2T до 64.1, но speech-side MMLU-S2T остается 43.77; с interleaving он растет до 58.98, а Medical-AVG EER падает до 6.87. Лучший JSTIP-Best-EER дает Medical-AVG EER 6.60, Banking EER 10.75 и SQA-S2T 42.07. По сравнению с open-source моделями JSTIP конкурентен, но не абсолютный лидер: Qwen Omni-3-30BA3B имеет Medical-AVG EER 5.84.

Ограничения. Работа сильна как training recipe, но зависит от качественного alignment и больших ASR ресурсов. Domain tests в основном entity-heavy medical/banking; не ясно, насколько вывод переносится на noisy conversational ASR, low-resource languages и streaming. SQA/MMLU используются как диагностика сохранения LLM-prior, а не как полноценная оценка spoken QA продукта.

Фишка из статьи. Самый показательный результат — не общий ASR TER, а gap между text-side и speech-side reasoning: interleaving резко уменьшает его.

СетапMedical EERMMLU-T2TMMLU-S2TS2T−T2T
ASR only7.9743.0135.68-7.33
+ Word-IL7.6446.8339.94-6.89
+ Segment-IL, silence7.7954.3749.92-4.45
+ Segment-IL, silence+punc.7.6953.5952.82-0.77
+ Mixed-IL, silence+punc.7.3251.2651.77+0.61

Как это читать: interleaving полезен не только как data augmentation. Он заставляет модель сохранять генеративную текстовую способность в speech-conditioned режиме; поэтому MMLU-S2T перестает сильно отставать от MMLU-T2T, а entity error rate одновременно улучшается.

Оригинальная статья на arXiv