SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis
SpeechSense переносит распознавание эмоций от общих меток «радость/грусть» к восьми социальным установкам говорящего: уверенности, нервозности, страстности, нетерпению, теплоте, апатии, сарказму и нейтральности. Главная экспериментальная идея - убрать подсказку из слов: один и тот же нейтральный текст озвучивается с разной просодией, поэтому модель должна слушать, как сказано. Результаты действительно показывают большой разрыв между звуковым и текстовым входом, хотя полностью синтетическое происхождение данных ограничивает вывод.
Метод. Для каждой метки Qwen3-Max создаёт 120 нейтральных фраз длительностью 3-8 секунд, а Lovo.ai озвучивает их через ролевые указания на 30 голосах. Из 960 исходных записей как минимум три участника Prolific оценивают каждую; 623 записи проходят по большинству, ещё 46 неоднозначных сохраняются, если хотя бы один оценщик совпал с заданной при синтезе меткой. Получается 669 проверочных записей с Fleiss' kappa 0,4437 и отдельные 1522 слабее размеченные обучающие записи, тексты для которых созданы Gemini 3 Pro. Для сравнения берутся Qwen2.5-Omni со звуком или только текстом, текстовые Qwen2.5-Instruct и три речевых кодировщика.
Результаты. Лучший Qwen2.5-Omni-7B со звуком достигает 56,95% точности и 56,76% Macro-F1, тогда как та же модель по тексту получает 26,76% и 22,27%. Whisper-large-v3, HuBERT и Wav2Vec2 без языкового рассуждения дают 42,45-45,06% Macro-F1. Без дообучения все варианты почти случайны: Macro-F1 от 1,31% до 6,63%. Синтетическая речь остаётся разборчивой: WER равен 3,70% на проверочной и 5,42% на обучающей части. Лучше всего определяется нервозность, 68-80% F1; нейтральность и уверенность у большинства моделей остаются ниже 45%.
Ограничения. Весь звук синтезирован одним коммерческим движком, только на английском и с 30 голосовыми профилями. Обучение и проверка используют одни голоса, хотя метки по ним сбалансированы, поэтому возможна зависимость от особенностей Lovo.ai. Согласие людей лишь умеренное, а 46 спорных примеров сохранены с опорой на замысел генератора. Нейтральный текст хорошо отделяет просодию, но одновременно делает задачу менее похожей на живую речь, где слова и интонация взаимодействуют. Проверочная выборка из 669 записей мала для восьми тонких классов.
Фишка из статьи. Сопоставление одной архитектуры в двух режимах служит почти контролируемым опытом на ценность просодии: меняется вход, а языковая основа остаётся той же.
| Модель | Вход | Точность до обучения | Macro-F1 до обучения | Точность после обучения | Macro-F1 после обучения |
|---|---|---|---|---|---|
| Qwen2.5-Omni-3B | текст | 8,22% | 3,79% | 25,26% | 19,71% |
| Qwen2.5-Omni-3B | звук | 3,74% | 1,31% | 54,86% | 53,38% |
| Qwen2.5-Omni-7B | текст | 11,36% | 6,20% | 26,76% | 22,27% |
| Qwen2.5-Omni-7B | звук | 11,96% | 2,96% | 56,95% | 56,76% |
Как это читать: после обучения звуковой режим выигрывает примерно 30 пунктов точности у текстового, то есть нейтральные фразы действительно не несут достаточной метки в словах. Но опыт доказывает роль просодии внутри синтетического протокола; для естественных разговоров нужен отдельный перенос.