паралингвистика выявление депрессии семантическая калибровка
arXiv eess.AS

ParaCalib: семантически откалиброванное моделирование паралингвистики для выявления депрессии

arXiv:2610.01103

ParaCalib пытается отличить акустические признаки депрессии от нормальной интонации, которая уместна по смыслу сказанного. Система сначала описывает голос в контексте реплики, а затем переводит свободное описание в структурированные паралингвистические признаки и оценку диагностической значимости.

Метод. Аудиоязыковая модель формирует контекстное описание темпа, энергии, высоты, пауз и других признаков. Отдельная языковая модель собирает SC-Para: фиксированный набор атрибутов плюс evidence score, показывающий, насколько акустика необычна именно для данного содержания. Классификатор обучается уже на этой структурированной записи.

Результаты. На DAIC-WOZ ParaCalib получает macro-F1 71,9%, чувствительность 77,1%, специфичность 73,3% и AUC 83,3%; у HAREN macro-F1 57,9%. На китайском MODMA macro-F1 достигает 90,5%, AUC — 96,4%. При удалении evidence score F1 падает на 5,0 п.п., без темпа речи — на 4,7, без энергии — на 4,5.

Ограничения. Два клинических корпуса малы, а метка участника переносится на отдельные фрагменты, хотя не каждая реплика несёт симптомы. Описания и оценки генерируют большие модели, поэтому возможны языковые и культурные смещения. Преимущество SC-Para над простым эмбеддингом описания статистически не подтверждено после поправки: p = 0,7269.

Фишка из статьи. В контролируемом опыте одно и то же акустическое описание получает разную диагностическую силу в зависимости от текста. Депрессивный контекст повышает evidence score на 8,6 пункта, тогда как нейтральный почти не отличается от режима без контекста.

Контекст при одинаковом описании голосаИзменение evidence score95% интервалВывод
Без смыслового контекста0опорный режимтолько акустика
Нейтральное содержание+0,1p = 0,92значимого сдвига нет
Содержание, связанное с депрессией+8,6[6,7; 10,6]акустика трактуется как более значимая

Как это читать: калибровка действительно использует смысл, а не просто пересказывает голос. Но тот же результат предупреждает о риске: модель может усиливать прогноз из-за темы высказывания и тем самым путать симптом с семантическим содержанием.

Оригинальная статья на arXiv