JSTIP: interleaved speech-text training для ASR с сохранением LLM-prior
JSTIP интересна тем, что разбирает слабое место speech-LLM интеграции для ASR: после большого supervised ASR fine-tuning текстовый prior LLM часто остается “рядом”, но плохо переносится в speech-conditioned режим. Авторы предлагают Joint Speech-Text Interleaved Pretraining: внутри aligned speech-text pairs они строят word-level, segment-level и mixed interleaved sequences, чтобы модель училась переключаться между аудио и текстом в одном autoregressive контексте.
Метод. Вместо простого смешивания ASR и text batches JSTIP вставляет текстовые сегменты в speech sequence по alignment: границы можно задавать по silence, punctuation или их комбинации. Это должно уменьшить modality gap: модель не только транскрибирует speech tokens, но и продолжает next-token prediction в текстовой форме. Проверка идет на 38k часов ASR data, entity-rich medical/banking тестах, MMLU/SQA diagnostics и domain adaptation через PubMed или synthetic TTS pairs.
Результаты. ASR-only baseline имеет Medical-AVG EER 7.97 и MMLU-S2T 35.68; добавление interleaving снижает EER до 7.32 и поднимает MMLU-S2T до 51.77. ASR+PubMed без interleaving улучшает MMLU-T2T до 64.1, но speech-side MMLU-S2T остается 43.77; с interleaving он растет до 58.98, а Medical-AVG EER падает до 6.87. Лучший JSTIP-Best-EER дает Medical-AVG EER 6.60, Banking EER 10.75 и SQA-S2T 42.07. По сравнению с open-source моделями JSTIP конкурентен, но не абсолютный лидер: Qwen Omni-3-30BA3B имеет Medical-AVG EER 5.84.
Ограничения. Работа сильна как training recipe, но зависит от качественного alignment и больших ASR ресурсов. Domain tests в основном entity-heavy medical/banking; не ясно, насколько вывод переносится на noisy conversational ASR, low-resource languages и streaming. SQA/MMLU используются как диагностика сохранения LLM-prior, а не как полноценная оценка spoken QA продукта.
Фишка из статьи. Самый показательный результат — не общий ASR TER, а gap между text-side и speech-side reasoning: interleaving резко уменьшает его.
| Сетап | Medical EER | MMLU-T2T | MMLU-S2T | S2T−T2T |
|---|---|---|---|---|
| ASR only | 7.97 | 43.01 | 35.68 | -7.33 |
| + Word-IL | 7.64 | 46.83 | 39.94 | -6.89 |
| + Segment-IL, silence | 7.79 | 54.37 | 49.92 | -4.45 |
| + Segment-IL, silence+punc. | 7.69 | 53.59 | 52.82 | -0.77 |
| + Mixed-IL, silence+punc. | 7.32 | 51.26 | 51.77 | +0.61 |
Как это читать: interleaving полезен не только как data augmentation. Он заставляет модель сохранять генеративную текстовую способность в speech-conditioned режиме; поэтому MMLU-S2T перестает сильно отставать от MMLU-T2T, а entity error rate одновременно улучшается.