SpeechCombine: instruction-following SLM без speech instruction tuning
SpeechCombine интересна тем, что атакует дорогую часть speech language models: instruction following обычно требует speech instruction data, а ее трудно масштабировать и чистить. Авторы предлагают другой путь: отдельно получить speech-adapted модель через continuous speech pretraining, а затем объединить ее с instruction delta от текстовой LLM.
Метод. Сначала берется base text LLM и адаптируется к речи на 30k часов speech pretraining. Отдельно есть instruction-tuned версия той же текстовой базы, поэтому можно вычислить весовой сдвиг Δθ_inst между instruction и base моделями. SpeechCombine комбинирует speech delta и instruction delta с коэффициентом λ, пытаясь сохранить способность понимать аудио и получить instruction behavior без отдельного speech instruction tuning.
Результаты. В ablation таблице полная модель получает Openbook accuracy 86.59, Emphatic Detection F1 60.84 и GenEmo score 45.42. Удаление reasoning-style режима “thinking” снижает Openbook accuracy до 64.83 и GenEmo до 36.37. Удаление instruction delta особенно больно для генерации: GenEmo score падает до 15.34, а Openbook accuracy — до 71.68. Это показывает, что weight-level перенос instruction behavior действительно несет основную часть эффекта.
Ограничения. Подход требует совместимых base/instruction checkpoints, чтобы delta была осмысленной. 30k часов speech pretraining — это все еще крупный ресурс, а не дешевый few-shot рецепт. Метрики частично task-specific; без более широкого набора speech QA, spoken dialogue и safety tests сложно понять, насколько надежно instruction following переносится в реальные голосовые продукты.
Фишка из статьи. Важная деталь — разные “отключения” ломают разные способности: без thinking страдает текстовое рассуждение, а без специальных speech/text markers почти исчезает speech-sensitive behavior.
| Вариант | Openbook Acc | Emphatic Detection F1 | GenEmo Score |
|---|---|---|---|
| Original SpeechCombine | 86.59 | 60.84 | 45.42 |
| No Thinking | 64.83 | 53.14 | 36.37 |
| No [cap] | 84.83 | 0.39 | 27.18 |
| No [Text] | 83.95 | 0.40 | 35.69 |
| No Δθ_inst | 71.68 | 40.38 | 15.34 |
Как это читать: speech instruction following здесь не появляется “магически” от speech pretraining. Instruction delta нужна для поведения ассистента, а markers вроде [cap] и [Text] оказываются критичными для того, чтобы модель правильно маршрутизировала речевые и текстовые способности.