Паралингвистика Просодия Набор данных
arXiv cs.CL

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

arXiv:2608.17931

SpeechSense переносит распознавание эмоций от общих меток «радость/грусть» к восьми социальным установкам говорящего: уверенности, нервозности, страстности, нетерпению, теплоте, апатии, сарказму и нейтральности. Главная экспериментальная идея - убрать подсказку из слов: один и тот же нейтральный текст озвучивается с разной просодией, поэтому модель должна слушать, как сказано. Результаты действительно показывают большой разрыв между звуковым и текстовым входом, хотя полностью синтетическое происхождение данных ограничивает вывод.

Метод. Для каждой метки Qwen3-Max создаёт 120 нейтральных фраз длительностью 3-8 секунд, а Lovo.ai озвучивает их через ролевые указания на 30 голосах. Из 960 исходных записей как минимум три участника Prolific оценивают каждую; 623 записи проходят по большинству, ещё 46 неоднозначных сохраняются, если хотя бы один оценщик совпал с заданной при синтезе меткой. Получается 669 проверочных записей с Fleiss' kappa 0,4437 и отдельные 1522 слабее размеченные обучающие записи, тексты для которых созданы Gemini 3 Pro. Для сравнения берутся Qwen2.5-Omni со звуком или только текстом, текстовые Qwen2.5-Instruct и три речевых кодировщика.

Результаты. Лучший Qwen2.5-Omni-7B со звуком достигает 56,95% точности и 56,76% Macro-F1, тогда как та же модель по тексту получает 26,76% и 22,27%. Whisper-large-v3, HuBERT и Wav2Vec2 без языкового рассуждения дают 42,45-45,06% Macro-F1. Без дообучения все варианты почти случайны: Macro-F1 от 1,31% до 6,63%. Синтетическая речь остаётся разборчивой: WER равен 3,70% на проверочной и 5,42% на обучающей части. Лучше всего определяется нервозность, 68-80% F1; нейтральность и уверенность у большинства моделей остаются ниже 45%.

Ограничения. Весь звук синтезирован одним коммерческим движком, только на английском и с 30 голосовыми профилями. Обучение и проверка используют одни голоса, хотя метки по ним сбалансированы, поэтому возможна зависимость от особенностей Lovo.ai. Согласие людей лишь умеренное, а 46 спорных примеров сохранены с опорой на замысел генератора. Нейтральный текст хорошо отделяет просодию, но одновременно делает задачу менее похожей на живую речь, где слова и интонация взаимодействуют. Проверочная выборка из 669 записей мала для восьми тонких классов.

Фишка из статьи. Сопоставление одной архитектуры в двух режимах служит почти контролируемым опытом на ценность просодии: меняется вход, а языковая основа остаётся той же.

МодельВходТочность до обученияMacro-F1 до обученияТочность после обученияMacro-F1 после обучения
Qwen2.5-Omni-3Bтекст8,22%3,79%25,26%19,71%
Qwen2.5-Omni-3Bзвук3,74%1,31%54,86%53,38%
Qwen2.5-Omni-7Bтекст11,36%6,20%26,76%22,27%
Qwen2.5-Omni-7Bзвук11,96%2,96%56,95%56,76%

Как это читать: после обучения звуковой режим выигрывает примерно 30 пунктов точности у текстового, то есть нейтральные фразы действительно не несут достаточной метки в словах. Но опыт доказывает роль просодии внутри синтетического протокола; для естественных разговоров нужен отдельный перенос.

Оригинальная статья на arXiv