Speech LLM Instruction Weight merging
Speech LLM

SpeechCombine: instruction-following SLM без speech instruction tuning

Acc 86.59

SpeechCombine интересна тем, что атакует дорогую часть speech language models: instruction following обычно требует speech instruction data, а ее трудно масштабировать и чистить. Авторы предлагают другой путь: отдельно получить speech-adapted модель через continuous speech pretraining, а затем объединить ее с instruction delta от текстовой LLM.

Метод. Сначала берется base text LLM и адаптируется к речи на 30k часов speech pretraining. Отдельно есть instruction-tuned версия той же текстовой базы, поэтому можно вычислить весовой сдвиг Δθ_inst между instruction и base моделями. SpeechCombine комбинирует speech delta и instruction delta с коэффициентом λ, пытаясь сохранить способность понимать аудио и получить instruction behavior без отдельного speech instruction tuning.

Результаты. В ablation таблице полная модель получает Openbook accuracy 86.59, Emphatic Detection F1 60.84 и GenEmo score 45.42. Удаление reasoning-style режима “thinking” снижает Openbook accuracy до 64.83 и GenEmo до 36.37. Удаление instruction delta особенно больно для генерации: GenEmo score падает до 15.34, а Openbook accuracy — до 71.68. Это показывает, что weight-level перенос instruction behavior действительно несет основную часть эффекта.

Ограничения. Подход требует совместимых base/instruction checkpoints, чтобы delta была осмысленной. 30k часов speech pretraining — это все еще крупный ресурс, а не дешевый few-shot рецепт. Метрики частично task-specific; без более широкого набора speech QA, spoken dialogue и safety tests сложно понять, насколько надежно instruction following переносится в реальные голосовые продукты.

Фишка из статьи. Важная деталь — разные “отключения” ломают разные способности: без thinking страдает текстовое рассуждение, а без специальных speech/text markers почти исчезает speech-sensitive behavior.

ВариантOpenbook AccEmphatic Detection F1GenEmo Score
Original SpeechCombine86.5960.8445.42
No Thinking64.8353.1436.37
No [cap]84.830.3927.18
No [Text]83.950.4035.69
No Δθ_inst71.6840.3815.34

Как это читать: speech instruction following здесь не появляется “магически” от speech pretraining. Instruction delta нужна для поведения ассистента, а markers вроде [cap] и [Text] оказываются критичными для того, чтобы модель правильно маршрутизировала речевые и текстовые способности.

Оригинальная статья на arXiv