Когда выбор слоя вводит в заблуждение при выявлении депрессии по речи
При выявлении депрессии по речи принято выбирать лучший слой самоконтролируемого кодировщика по той же перекрёстной проверке, которой затем измеряют качество. Статья показывает, что такая процедура заметно завышает AUC даже при случайных метках, и предлагает вложенную перекрёстную проверку как обязательный минимум.
Метод. Авторы сравнивают 25 слоёв wav2vec 2.0, data2vec, WavLM, Whisper и HuBERT на DAIC-WOZ, отделяя внутренний выбор слоя от внешней оценки. Контрольные эксперименты включают 300 безсигнальных симуляций, 500 перестановок меток и перенос проверки на итальянский Androids. Отдельно построена интерпретируемая модель из 119 аффективных, временных и eGeMAPS-признаков.
Результаты. Наивная оценка data2vec падает с AUC 0,73 до 0,66 после вложенной проверки, wav2vec 2.0 — с 0,65 до 0,56, HuBERT — с 0,69 до 0,64. Интерпретируемая модель получает 0,75±0,03 и превосходит глубокие представления. На отложенных 47 участниках порядок систем нестабилен: корреляция рангов между перекрёстной проверкой и тестом равна 0,25, а среди пяти кодировщиков — −0,97.
Ограничения. Основной набор содержит лишь 140 обучающих и 47 тестовых участников, поэтому дисперсия велика. Более широкий анализ признаков проведён в основном на одном англоязычном корпусе; перенос на клинические условия, языки и способы записи не установлен. Высокая AUC интерпретируемой модели не означает клинической готовности.
Фишка из статьи. Перестановка меток даёт очень наглядную проверку утечки выбора модели: если в данных нет сигнала, процедура всё равно «находит» хороший слой.
| Контроль без сигнала | Наивный выбор лучшего слоя | Вложенная проверка |
|---|---|---|
| 300 симуляций, 25 слоёв | AUC 0,64±0,03; все прогоны выше 0,55 | 0,50±0,07 |
| DAIC-WOZ, перемешанные метки | 0,59 | 0,50 |
| Androids, перемешанные метки | 0,58 | 0,50 |
| DAIC-WOZ при n=40 | Среднее завышение достигает 0,14 AUC | |
Как это читать: проблема не в конкретном кодировщике, а в многократном выборе по шумной оценке. Чем меньше выборка и больше проверяемых слоёв, тем убедительнее выглядит случайный победитель.