Audio sentiment KD ASR transcripts
Paralinguistics

Audio sentiment через generated multilingual transcripts и distillation

Acc 0.6506

Статья рассматривает speech sentiment как задачу, где аудио несет prosody и affect, но часть сигнала живет в словах: sarcasm, polarity markers, lexical choice. Авторы используют generated text modalities как privileged information: сначала строят тяжелого multimodal teacher из аудио, ASR transcript и машинных переводов, а затем distill его в audio-only WavLM student. Практический смысл в том, что дополнительные text views нужны только на training/teacher stage, а production inference остается audio-only.

Метод. Каждый utterance из MSP-Podcast сначала транскрибируется Faster-Whisper в English, затем переводится NLLB-200 в Spanish, German и French. Для text-only branches используются RoBERTa/RoBERTuito/GBERT/CamemBERT с LoRA, для audio branch - WavLM-base-plus. Cascaded Cross-Modal Transformer (CCMT) поочередно интегрирует acoustic и generated text views, после чего WavLM student обучается через cross-entropy плюс KD loss от teacher при temperature 2.0 и lambda=0.7.

Результаты. На MSP-Podcast авторы используют official split: 169,190 train, 34,399 development и 46,294 test-1 samples; labels сведены к negative/neutral/positive. Audio-only Whisper получает macro-F1 0.5699 и accuracy 0.5723, WavLM baseline - 0.6239 и 0.6425. Лучшие CCMT teachers дают около 0.682-0.683 macro-F1 и 0.692-0.694 accuracy, но очень медленны: Audio+En+Fr занимает 25,082 ms, all modalities - 76,000 ms на RTX 4060 batch size 8. Distilled WavLM from Audio+En+Fr повышает macro-F1 до 0.6393 и accuracy до 0.6506 при 211 ms, то есть почти без overhead к WavLM baseline 213 ms.

Ограничения. Text modalities зависят от ASR и MT ошибок; если домен или язык меняется, teacher может выучить artifacts transcript pipeline. Полярность получена маппингом emotion/valence labels, что упрощает affective state. Тяжелый multimodal teacher непрактичен для online inference, а измерения latency даны на одной RTX 4060 и не раскрывают end-to-end ASR/translation cost для teacher construction.

Фишка из статьи. Главная инженерная часть - latency/quality trade-off. Multimodal teacher заметно лучше, но слишком дорогой; distillation забирает часть выигрыша и возвращает inference к стоимости audio-only модели.

МодельМодальностиMacro-F1AccuracyTime
WhisperAudio0.56990.5723180 ms
WavLM baselineAudio0.62390.6425213 ms
CCMTAudio+English0.68120.69103404 ms
CCMTAudio+English+French0.68260.694025082 ms
CCMTAudio+En+Es+De+Fr0.68120.690376000 ms
WavLM KDAudio at inference0.63930.6506211 ms

Как это читать: больше text modalities не обязательно лучше и почти всегда дороже. Интересный результат в том, что student с KD дает небольшой, но честный прирост над WavLM без увеличения inference time; это типичный privileged-information сценарий, а не попытка тащить ASR+MT в runtime.

Оригинальная статья на arXiv