Instruction-following speech processing: SpeechMapper плюс synthetic SQA для IWSLT 2026
Системная статья NAVER LABS Europe интересна тем, что показывает практический рецепт для constrained instruction-following speech processing: одна система должна делать ASR, speech translation и spoken question answering из английской речи в немецкий, итальянский и китайский. Главный ход — заменить speech projector на SpeechMapper, обучаемый только на ASR data, и добавить synthetic SQA corpus fakACL из сгенерированных научных презентаций, озвученных SeamlessM4T-large-v2.
Метод. Pipeline многоступенчатый. SpeechMapper обучается на ASR данных CoVoST2, EuroParlST, GigaST и LibriSQA 500k steps на 4×A100-80GB. Text-only LoRA учится на MT/SQA данных 30k steps. Затем multimodal training объединяет speech projector и LoRA, с sampling ratios 0.3/0.4/0.3 для ASR/ST/SQA и всего 3k steps на одном A100-80GB. В training mix входят реальные и synthetic данные, включая fakACL, где английский текст генерируется Qwen prompting, сегментируется и синтезируется в речь.
Результаты. Projector-only SpeechMapper дает WER 14.2, COMET 73.5/80.1/79.7 для en-de/en-it/en-zh и SQA Part I/II 84.4/72.1. Multimodal setup 2 резко улучшает ASR до WER 7.4 и дает COMET 76.3/84.4/81.3, SQA 87.9/80.2. Setup 1 хуже по WER (8.2), но почти лучший по SQA Part II: 82.5. BEST-IWSLT25-IF остается сильным ASR baseline с WER 7.3, но multimodal setup 2 лучше по en-it/en-zh COMET и SQA.
Ограничения. Это challenge system paper, поэтому выводы завязаны на конкретный benchmark и constrained setting. Часть данных synthetic, включая fakACL и target-side MT; значит возможны style artifacts и mismatch с реальными лекциями. Авторы прямо отмечают trade-off: улучшение ASR/ST не всегда совместимо с лучшим SQA, а Qwen backbone чувствителен к noise в projected embeddings.
Фишка из статьи. Полезная деталь — маленький multimodal finetune на 3k steps может вернуть ASR качество почти до прошлогоднего best system, но выбор learning rate/setup меняет баланс ASR/ST/SQA.
| Модель | ASR WER | COMET en-de | COMET en-it | COMET en-zh | SQA I | SQA II |
|---|---|---|---|---|---|---|
| SpeechMapper projector-only | 14.2 | 73.5 | 80.1 | 79.7 | 84.4 | 72.1 |
| BEST-IWSLT25-IF | 7.3 | 77.3 | 84.2 | 80.2 | 82.0 | 63.0 |
| SpeechMapper+LoRA setup 1 | 8.2 | 75.1 | 83.2 | 80.6 | 86.2 | 82.5 |
| SpeechMapper+LoRA setup 2 | 7.4 | 76.3 | 84.4 | 81.3 | 87.9 | 80.2 |
Как это читать: setup 2 почти догоняет ASR baseline и лучше переводит на итальянский/китайский, но setup 1 лучше по сложной SQA Part II. Для multi-task speech agents это важный сигнал: single leaderboard score скрывает реальный trade-off между распознаванием, переводом и ответом на вопросы.