StanceBench: аудио-оценка эмпатии, уверенности и конфликта в речи
StanceBench предлагает бенчмарк для оценки межличностной позиции в разговорной речи: эмпатии, поддержки, уверенности, честности, внимательности и конфликта. Это шире обычного распознавания эмоций, потому что модель должна учитывать не только слова, но и просодию, роль говорящего и иногда контекст собеседника. Главный вклад - не новая модель, а протокол, где audio LLM выступают судьями по девяти шкалам с проверкой согласованности и небольшой человеческой валидацией.
Метод. Авторы выделяют target speaker segments и при необходимости добавляют контекст другого говорящего; короткие backchannel-фрагменты отбрасываются, активная речь обычно лежит в пределах 1-15 секунд для цели и 1-10 секунд для контекста. Судьи получают парные полюса шкалы, например более поддерживающий или менее поддерживающий ответ. Оцениваются failure rate, несогласие между сегментами, pole consistency, oracle F1, AUROC и корреляция с человеческим консенсусом.
Результаты. Закрытые audio LLM в среднем стабильнее открытых: у GPT-аудио failure rate почти нулевой, у Gemini обычно 0-2%, тогда как у Qwen2.5-Omni на некоторых шкалах доходит до 30%. По human correlation лучшие результаты зависят от шкалы: для empathy и support корреляции могут быть высокими, а attentiveness и honesty оказываются заметно сложнее. Например, для S8 GPT получает human correlation 0.84, Gemini 0.82, Qwen 0.56; для S5 Gemini падает до 0.05, что показывает нестабильность отдельных конструктов.
Ограничения. У таких шкал нет единственной "истинной" разметки: человеческая подвыборка всего 122 уникальных экземпляра и по две оценки на экземпляр. Часть метрик проверяет внутреннюю согласованность модели, а не соответствие человеку. Поэтому StanceBench лучше читать как диагностический стенд для паралингвистических судей, а не как окончательный лидерборд понимания общения.
Фишка из статьи. Полезна таблица по отдельным шкалам: она показывает, что модели могут быть сильны на эмпатии и поддержке, но ломаться на внимательности или честности. Среднее значение скрывает эту неоднородность.
| Шкала | Модель | Failure rate | Oracle F1 | AUROC | Human corr. |
|---|---|---|---|---|---|
| S1 | Gemini | 0.02 | 0.93 | 0.96 | 0.86 |
| S2 | Qwen | 0.18 | 0.89 | 0.87 | 0.87 |
| S5 | Gemini | 0.00 | 0.89 | 0.76 | 0.05 |
| S8 | GPT-аудио | 0.00 | 0.63 | 0.76 | 0.84 |
Как это читать: высокая внутренняя разделимость не гарантирует совпадение с людьми. Для S5 Gemini дает неплохие F1/AUROC, но почти нулевую корреляцию с человеческой оценкой, и это важнее для прикладного анализа разговора.