A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls
Уклончивый ответ и неуверенная манера речи — разные сигналы: руководитель может говорить уверенно и не отвечать по существу или, наоборот, колебаться в прямом ответе. DualEvasion впервые размечает обе оси независимо и показывает, что современные модели значительно лучше читают уклонение по тексту, чем неуверенность по голосу.
Метод. Набор содержит 505 пар «вопрос–ответ» из 60 звонков по финансовой отчётности 49 компаний за 2023–2025 годы. Два финансовых специалиста отдельно размечают текстовую уклончивость и голосовую уверенность; перед голосовой оценкой они слушают другие ответы того же руководителя. Текстовые и звуковые модели проверяются без дообучения, а отдельный опыт даёт им три опорные реплики диктора и просит сначала оценить его обычную манеру.
Результаты. Лучший текстовый результат достигает macro F1 87,4, а лучший звуковой — лишь 58,5; для класса неуверенной речи F1 не превышает 39,2. Согласие людей составляет κ=0,866 для текста и 0,774 для голоса, тогда как модель–человек — 0,813 и 0,225. В 162 из 505 случаев, 32,1%, текстовая и голосовая метки расходятся, подтверждая, что одна модальность не заменяет другую.
Ограничения. Корпус мал, коммерчески лицензирован и ограничен финансовыми звонками; уверенность — лишь одна сторона голосового поведения и не доказывает правдивость. Связь меток с биржевой волатильностью рассчитана всего по 60 звонкам и носит разведочный, не причинный характер. Баланс классов заметно смещён к уверенным прямым ответам.
Фишка из статьи. Простая подача нескольких реплик того же диктора не даёт устойчивого выигрыша. Улучшение появляется лишь когда инструкция заставляет модель явно вывести обычные высоту, темп и просодию говорящего, но даже тогда прирост скромен.
| Звуковая модель | F1 неуверенности без нормы | С нормой говорящего | Прирост |
|---|---|---|---|
| Gemini-2.5-Flash | 38,5 | 43,2 | +4,7 |
| Gemini-3-Flash | 38,7 | 41,6 | +2,9 |
| GPT-Audio | 38,2 | 39,2 | +1,0 |
Как это читать: модели склонны принимать абсолютную высоту, скорость или число пауз за неуверенность. Явная норма говорящего частично устраняет эту подмену, но до согласия финансовых специалистов остаётся большой разрыв.