Audio LLM Просодия Benchmark
Паралингвистика

StanceBench: аудио-оценка эмпатии, уверенности и конфликта в речи

9 stances

StanceBench предлагает бенчмарк для оценки межличностной позиции в разговорной речи: эмпатии, поддержки, уверенности, честности, внимательности и конфликта. Это шире обычного распознавания эмоций, потому что модель должна учитывать не только слова, но и просодию, роль говорящего и иногда контекст собеседника. Главный вклад - не новая модель, а протокол, где audio LLM выступают судьями по девяти шкалам с проверкой согласованности и небольшой человеческой валидацией.

Метод. Авторы выделяют target speaker segments и при необходимости добавляют контекст другого говорящего; короткие backchannel-фрагменты отбрасываются, активная речь обычно лежит в пределах 1-15 секунд для цели и 1-10 секунд для контекста. Судьи получают парные полюса шкалы, например более поддерживающий или менее поддерживающий ответ. Оцениваются failure rate, несогласие между сегментами, pole consistency, oracle F1, AUROC и корреляция с человеческим консенсусом.

Результаты. Закрытые audio LLM в среднем стабильнее открытых: у GPT-аудио failure rate почти нулевой, у Gemini обычно 0-2%, тогда как у Qwen2.5-Omni на некоторых шкалах доходит до 30%. По human correlation лучшие результаты зависят от шкалы: для empathy и support корреляции могут быть высокими, а attentiveness и honesty оказываются заметно сложнее. Например, для S8 GPT получает human correlation 0.84, Gemini 0.82, Qwen 0.56; для S5 Gemini падает до 0.05, что показывает нестабильность отдельных конструктов.

Ограничения. У таких шкал нет единственной "истинной" разметки: человеческая подвыборка всего 122 уникальных экземпляра и по две оценки на экземпляр. Часть метрик проверяет внутреннюю согласованность модели, а не соответствие человеку. Поэтому StanceBench лучше читать как диагностический стенд для паралингвистических судей, а не как окончательный лидерборд понимания общения.

Фишка из статьи. Полезна таблица по отдельным шкалам: она показывает, что модели могут быть сильны на эмпатии и поддержке, но ломаться на внимательности или честности. Среднее значение скрывает эту неоднородность.

ШкалаМодельFailure rateOracle F1AUROCHuman corr.
S1Gemini0.020.930.960.86
S2Qwen0.180.890.870.87
S5Gemini0.000.890.760.05
S8GPT-аудио0.000.630.760.84

Как это читать: высокая внутренняя разделимость не гарантирует совпадение с людьми. Для S5 Gemini дает неплохие F1/AUROC, но почти нулевую корреляцию с человеческой оценкой, и это важнее для прикладного анализа разговора.

Оригинальная статья на arXiv