ASR Speech translation SQA
Speech translation / SQA

Instruction-following speech processing: SpeechMapper плюс synthetic SQA для IWSLT 2026

WER 7.4

Системная статья NAVER LABS Europe интересна тем, что показывает практический рецепт для constrained instruction-following speech processing: одна система должна делать ASR, speech translation и spoken question answering из английской речи в немецкий, итальянский и китайский. Главный ход — заменить speech projector на SpeechMapper, обучаемый только на ASR data, и добавить synthetic SQA corpus fakACL из сгенерированных научных презентаций, озвученных SeamlessM4T-large-v2.

Метод. Pipeline многоступенчатый. SpeechMapper обучается на ASR данных CoVoST2, EuroParlST, GigaST и LibriSQA 500k steps на 4×A100-80GB. Text-only LoRA учится на MT/SQA данных 30k steps. Затем multimodal training объединяет speech projector и LoRA, с sampling ratios 0.3/0.4/0.3 для ASR/ST/SQA и всего 3k steps на одном A100-80GB. В training mix входят реальные и synthetic данные, включая fakACL, где английский текст генерируется Qwen prompting, сегментируется и синтезируется в речь.

Результаты. Projector-only SpeechMapper дает WER 14.2, COMET 73.5/80.1/79.7 для en-de/en-it/en-zh и SQA Part I/II 84.4/72.1. Multimodal setup 2 резко улучшает ASR до WER 7.4 и дает COMET 76.3/84.4/81.3, SQA 87.9/80.2. Setup 1 хуже по WER (8.2), но почти лучший по SQA Part II: 82.5. BEST-IWSLT25-IF остается сильным ASR baseline с WER 7.3, но multimodal setup 2 лучше по en-it/en-zh COMET и SQA.

Ограничения. Это challenge system paper, поэтому выводы завязаны на конкретный benchmark и constrained setting. Часть данных synthetic, включая fakACL и target-side MT; значит возможны style artifacts и mismatch с реальными лекциями. Авторы прямо отмечают trade-off: улучшение ASR/ST не всегда совместимо с лучшим SQA, а Qwen backbone чувствителен к noise в projected embeddings.

Фишка из статьи. Полезная деталь — маленький multimodal finetune на 3k steps может вернуть ASR качество почти до прошлогоднего best system, но выбор learning rate/setup меняет баланс ASR/ST/SQA.

МодельASR WERCOMET en-deCOMET en-itCOMET en-zhSQA ISQA II
SpeechMapper projector-only14.273.580.179.784.472.1
BEST-IWSLT25-IF7.377.384.280.282.063.0
SpeechMapper+LoRA setup 18.275.183.280.686.282.5
SpeechMapper+LoRA setup 27.476.384.481.387.980.2

Как это читать: setup 2 почти догоняет ASR baseline и лучше переводит на итальянский/китайский, но setup 1 лучше по сложной SQA Part II. Для multi-task speech agents это важный сигнал: single leaderboard score скрывает реальный trade-off между распознаванием, переводом и ответом на вопросы.

Оригинальная статья на arXiv