ParaCalib: семантически откалиброванное моделирование паралингвистики для выявления депрессии
ParaCalib пытается отличить акустические признаки депрессии от нормальной интонации, которая уместна по смыслу сказанного. Система сначала описывает голос в контексте реплики, а затем переводит свободное описание в структурированные паралингвистические признаки и оценку диагностической значимости.
Метод. Аудиоязыковая модель формирует контекстное описание темпа, энергии, высоты, пауз и других признаков. Отдельная языковая модель собирает SC-Para: фиксированный набор атрибутов плюс evidence score, показывающий, насколько акустика необычна именно для данного содержания. Классификатор обучается уже на этой структурированной записи.
Результаты. На DAIC-WOZ ParaCalib получает macro-F1 71,9%, чувствительность 77,1%, специфичность 73,3% и AUC 83,3%; у HAREN macro-F1 57,9%. На китайском MODMA macro-F1 достигает 90,5%, AUC — 96,4%. При удалении evidence score F1 падает на 5,0 п.п., без темпа речи — на 4,7, без энергии — на 4,5.
Ограничения. Два клинических корпуса малы, а метка участника переносится на отдельные фрагменты, хотя не каждая реплика несёт симптомы. Описания и оценки генерируют большие модели, поэтому возможны языковые и культурные смещения. Преимущество SC-Para над простым эмбеддингом описания статистически не подтверждено после поправки: p = 0,7269.
Фишка из статьи. В контролируемом опыте одно и то же акустическое описание получает разную диагностическую силу в зависимости от текста. Депрессивный контекст повышает evidence score на 8,6 пункта, тогда как нейтральный почти не отличается от режима без контекста.
| Контекст при одинаковом описании голоса | Изменение evidence score | 95% интервал | Вывод |
|---|---|---|---|
| Без смыслового контекста | 0 | опорный режим | только акустика |
| Нейтральное содержание | +0,1 | p = 0,92 | значимого сдвига нет |
| Содержание, связанное с депрессией | +8,6 | [6,7; 10,6] | акустика трактуется как более значимая |
Как это читать: калибровка действительно использует смысл, а не просто пересказывает голос. Но тот же результат предупреждает о риске: модель может усиливать прогноз из-за темы высказывания и тем самым путать симптом с семантическим содержанием.