Диаризация роли и языка в многоязычных интервью пожилых людей
Эта статья применяет диаризацию не как самоцель, а как инструмент анализа владения языком в многоязычных интервью с пожилыми людьми. Нужно отделить речь респондента от интервьюера, определить язык сегментов и затем проверить, связаны ли такие признаки с экспертной оценкой fluency. Интересна связка речевой обработки и прикладной геронтологической выборки, где шум, code-switching и короткие ответы являются частью задачи.
Метод. Авторы строят Whisper-based системы для speaker-role diarization и language diarization, сравнивая оригинальные Whisper-представления с VoxLect-адаптированными. После автоматической разметки извлекаются поведенческие признаки: доля речи респондента, доля целевого языка, невербальные вокализации. Для оценки владения языком используются регрессия и бинарная классификация с теми же split, что и у диаризации.
Результаты. Корпус содержит 548 записей от 360 дикторов, всего 9.71 часа, возраст участников 60-105 лет. Speaker-role DER держится в диапазоне 20.43-21.62%, а speaker confusion низкий, 4.30-5.77%. Для language diarization VoxLect сильно снижает языковую путаницу: при oracle VAD у Whisper-Small LC падает с 47.71% до 28.31%, у Whisper-Large с 35.03% до 27.97%; при predicted VAD у Large DER снижается с 46.17% до 40.47. В downstream-задаче ансамбль diarization+Whisper дает 65.82% accuracy и 65.80 macro-F1.
Ограничения. Датасет небольшой и очень специфичный: пожилые участники, индийские языки, интервьюер-респондент, оценки владения с умеренной согласованностью экспертов. Role DER около 20% все еще высок для точного клинического вывода. Выводы о поведенческих признаках стоит переносить только в похожие интервью, а не в произвольные разговоры.
Фишка из статьи. Самая полезная часть - OLS-анализ показывает, что простые признаки диаризации остаются информативными даже после автоматической разметки.
| Сравнение | Число | Что означает |
|---|---|---|
| Speech ratio | coef 0.368, p<0.05 в 100% | Больше доля речи респондента связана с более высокой оценкой |
| Intended language prob. | coef 0.246, p<0.05 в 97.42% | Целевой язык остается маркером даже с predicted VAD |
| Adjusted R2 speaker features | 0.167 | Автоматические speaker regions сохраняют основной сигнал |
| Diarization-only regression | PCC 0.440 | Простые признаки почти равны oracle-режиму 0.441 |
| Классификация ensemble | 65.82% accuracy | Whisper-признаки и диаризация дополняют друг друга |
Как это читать: это редкий пример, где ошибка диаризации не просто измеряется, а проверяется через последующую прикладную задачу.