WQ-Fusion: Whisper и Qwen как дополняющие друг друга аудио-энкодеры
WQ-Fusion интересен как инженерный ответ на проблему “одного универсального аудио-энкодера”. Авторы не пытаются полностью дообучать большой backbone, а соединяют frozen Whisper-Large и Qwen2-Audio-7B: первый силен в фонетике и речевых признаках, второй лучше покрывает non-speech audio и более семантические задачи. Главный ход — заменить статическое concatenation на adaptive feature modulation и gated attention, чтобы модель сама выбирала, какой encoder полезнее для текущего акустического контекста.
Метод
Сначала признаки Whisper и Qwen проходят через Adaptive Feature Modulation: для входной последовательности предсказываются scale и shift параметры, похожие по духу на FiLM. Затем к токенам добавляются RoPE для временной структуры и learnable module embeddings, чтобы downstream блок видел, от какого encoder пришел сигнал. Fusion выполняется single-layer Gated Transformer с 8 attention heads и hidden dimension 1280.
Backbone encoders и core LLM остаются frozen. Обучаются projection layers, LoRA matrices и новые fusion/adaptation модули. Это принципиально: статья показывает не “больше compute на backbone”, а lightweight cross-model routing поверх уже сильных аудио-представлений.
Результаты
- Benchmark включает 15 datasets в speech, sound и music domains: Speech Commands, LibriCount, VoxLingua107, VoxCeleb1, ASVspoof, FSC, VocalSound, CREMA-D, ESC-50, FSD50k, UrbanSound8K, FSD18-Kaggle, GTZAN, NSynth-I и FMA.
- Лучший single encoder — Qwen2-Audio-7B с overall score 0.796; Whisper-Large дает 0.754.
- Простое Whisper+Qwen concatenation уже поднимает score до 0.820, показывая, что признаки действительно complementary.
- Adaptation + обычный Transformer дает 0.829, gated Transformer без adaptation — 0.832, полный WQ-Fusion — 0.836.
- На отдельных задачах WQ-Fusion особенно силен на ESC-50 (0.930), VoxCeleb1 (0.985), FSC (0.995), LibriCount (0.583) и FMA (0.725).
Ограничения
Работа проверяется как encoder benchmark, а не как end-to-end ASR/TTS/enhancement система. Overall score полезен для сравнения, но смешивает разные задачи и может скрывать, что на некоторых speech-specific benchmarks лучший single encoder или другая fusion-схема почти не хуже. Также Qwen2-Audio-7B и Whisper-Large — тяжелая пара, поэтому “lightweight” относится к обучаемому fusion layer, а не к полной inference стоимости всей системы.
Фишка из статьи. Самый сильный аргумент — ablation от static concat к gated fusion. Он показывает, что прирост не сводится к “склеили два больших encoder-а”; gating сам по себе дает больший прирост, чем vanilla Transformer, а adaptive modulation добавляет последний шаг.
| Вариант | Overall score | Что добавлено |
|---|---|---|
| Qwen2-Audio-7B | 0.796 | Лучший single-encoder baseline. |
| Whisper + Qwen concat | 0.820 | Статическое объединение уже подтверждает complementary признаки. |
| Adaptation + Transformer | 0.829 | Feature adaptation помогает согласовать пространства encoder-ов. |
| Gated Transformer | 0.832 | Gating лучше vanilla attention регулирует вклад разных encoder-ов. |
| WQ-Fusion | 0.836 | AFM + element-wise gated attention дают лучший общий результат. |
Как это читать: если строить универсальный audio embedding слой для speech, sound events и music, один encoder почти неизбежно будет иметь доменный перекос. WQ-Fusion показывает практичный путь: не выбирать между speech-centric и semantic/audio-centric backbone, а обучить небольшой routing слой поверх обоих.