Audio sentiment через generated multilingual transcripts и distillation
Статья рассматривает speech sentiment как задачу, где аудио несет prosody и affect, но часть сигнала живет в словах: sarcasm, polarity markers, lexical choice. Авторы используют generated text modalities как privileged information: сначала строят тяжелого multimodal teacher из аудио, ASR transcript и машинных переводов, а затем distill его в audio-only WavLM student. Практический смысл в том, что дополнительные text views нужны только на training/teacher stage, а production inference остается audio-only.
Метод. Каждый utterance из MSP-Podcast сначала транскрибируется Faster-Whisper в English, затем переводится NLLB-200 в Spanish, German и French. Для text-only branches используются RoBERTa/RoBERTuito/GBERT/CamemBERT с LoRA, для audio branch - WavLM-base-plus. Cascaded Cross-Modal Transformer (CCMT) поочередно интегрирует acoustic и generated text views, после чего WavLM student обучается через cross-entropy плюс KD loss от teacher при temperature 2.0 и lambda=0.7.
Результаты. На MSP-Podcast авторы используют official split: 169,190 train, 34,399 development и 46,294 test-1 samples; labels сведены к negative/neutral/positive. Audio-only Whisper получает macro-F1 0.5699 и accuracy 0.5723, WavLM baseline - 0.6239 и 0.6425. Лучшие CCMT teachers дают около 0.682-0.683 macro-F1 и 0.692-0.694 accuracy, но очень медленны: Audio+En+Fr занимает 25,082 ms, all modalities - 76,000 ms на RTX 4060 batch size 8. Distilled WavLM from Audio+En+Fr повышает macro-F1 до 0.6393 и accuracy до 0.6506 при 211 ms, то есть почти без overhead к WavLM baseline 213 ms.
Ограничения. Text modalities зависят от ASR и MT ошибок; если домен или язык меняется, teacher может выучить artifacts transcript pipeline. Полярность получена маппингом emotion/valence labels, что упрощает affective state. Тяжелый multimodal teacher непрактичен для online inference, а измерения latency даны на одной RTX 4060 и не раскрывают end-to-end ASR/translation cost для teacher construction.
Фишка из статьи. Главная инженерная часть - latency/quality trade-off. Multimodal teacher заметно лучше, но слишком дорогой; distillation забирает часть выигрыша и возвращает inference к стоимости audio-only модели.
| Модель | Модальности | Macro-F1 | Accuracy | Time |
|---|---|---|---|---|
| Whisper | Audio | 0.5699 | 0.5723 | 180 ms |
| WavLM baseline | Audio | 0.6239 | 0.6425 | 213 ms |
| CCMT | Audio+English | 0.6812 | 0.6910 | 3404 ms |
| CCMT | Audio+English+French | 0.6826 | 0.6940 | 25082 ms |
| CCMT | Audio+En+Es+De+Fr | 0.6812 | 0.6903 | 76000 ms |
| WavLM KD | Audio at inference | 0.6393 | 0.6506 | 211 ms |
Как это читать: больше text modalities не обязательно лучше и почти всегда дороже. Интересный результат в том, что student с KD дает небольшой, но честный прирост над WavLM без увеличения inference time; это типичный privileged-information сценарий, а не попытка тащить ASR+MT в runtime.