Why ML-based cough models do not generalize: a systematic cross-dataset evaluation for tuberculosis screening
Статья объясняет, почему убедительная точность распознавания туберкулеза по кашлю внутри одного набора не превращается в надежный скрининг в другой клинике. Систематическая перекрестная проверка CODA, TBscreen и Zambia показывает, что модели выучивают устройство записи, место сбора и распространенность болезни не хуже, чем признаки самого кашля.
Метод. Авторы сравнивают классические акустические признаки, VGGish и модели на мел-спектрограммах. Внутренняя оценка использует вложенную перекрестную проверку по людям: пять внешних и четыре внутренних разбиения, повторенных дважды. Затем каждая модель без дополнительной настройки переносится на другие наборы. Балансировка проводится одновременно по метке и условиям записи, а представления анализируются по устройствам и странам.
Результаты. Лучший внутренний ROC-AUC глубокой модели достигает 0,755±0,056 на Zambia, но при переносе падает до 0,632 на пассивной части TBscreen и 0,581 на CODA; модели, обученные на TBscreen или CODA, за пределами своего набора часто не достигают 0,6. Даже клиническая логистическая модель снижается с 0,767±0,025 внутри Zambia до 0,655 и 0,673 на внешних данных. Несовпадение устройств отнимает до 0,092 AUC, а скрытые представления явно группируются по прибору и набору.
Ограничения. Исследование ограничено доступными открытыми поднаборами и несколькими площадками. Устройство, страна, популяция и протокол сбора частично спутаны, поэтому точную долю каждого источника смещения установить нельзя. Работа диагностирует проблему, но не показывает клинически готового способа ее устранения; применять такие оценки как медицинский тест преждевременно.
Фишка из статьи. Внутри Zambia объединение трех телефонов улучшает перенос на отдельный диктофон, хотя число уникальных людей почти не растет. Это редкий контроль, позволяющий отделить пользу разнообразия каналов от банального увеличения выборки.
| Телефоны в обучении | Уникальных участников | ROC-AUC на отдельном диктофоне |
|---|---|---|
| Phone A | 632 | 0,675 |
| Phone B | 628 | 0,655 |
| Phone C | 642 | 0,725 |
| A + B + C | 650 | 0,732 |
Как это читать: объединенный набор содержит лишь на 8–22 человека больше одиночных вариантов, но охватывает три тракта записи и дает лучший внешний результат. Для кашлевых моделей разнообразие микрофонов здесь ценнее почти того же числа дополнительных пациентов.