EEG Слуховые устройства Речь
Слуховое внимание

CRF для нейроуправляемого выделения внимательного диктора

92.4% NC

Работа про auditory attention decoding: по EEG нужно понять, какого диктора слушает человек. Это важно для будущих слуховых устройств, которые усиливают не просто самый громкий голос, а выбранный вниманием источник. Авторы формулируют внимание как устойчивое марковское состояние и обучают последовательность целиком, вместо того чтобы классифицировать каждое короткое окно независимо и потом сглаживать результат.

Метод. Основная идея - CRF над двумя состояниями внимания. Любой AAD-backbone выдает logits для окон, а CRF учит не только локальные emissions, но и переходы между состояниями, стартуя с обычной HMM-инициализации. Дополнительно вводится ESCNet: легкий backbone, который сохраняет временно выровненные EEG-speech признаки и превращает разность средних Pearson correlations для двух речевых потоков в logits состояния. Поддержаны causal decoding для онлайн-режима и non-causal decoding для offline-анализа.

Результаты. На динамическом AVGC с окнами 1 с ESCNet дает raw accuracy 55.7%, post-hoc HMM causal 77.5% и non-causal 84.3%, а CE+CRF с learned transition rate поднимает их до 86.5% и 92.4%. На 4-секундных окнах ESCNet CRF достигает 89.8% causal и 95.9% non-causal, но задержка переключения растет до 79.6 с. На статических KUL и USTC при 1-секундном окне CRF улучшает causal decoding относительно fixed-rate HMM на +5.6 и +2.0 процентных пункта, до 87.7% и 82.9%.

Ограничения. Для реального слухового устройства non-causal режим недоступен, а causal режим нужно оценивать вместе с задержкой переключения. Даже лучший вариант с 1-секундными окнами имеет mean switch delay 23.3 с, что может быть слишком медленно для живого диалога. Эксперименты идут на стандартных EEG-наборах, без проверки на пользователях со снижением слуха и без полного профиля задержки устройства.

Фишка из статьи. Абляция показывает, что основной выигрыш дает не просто подбор другой вероятности переключения, а обучение emissions под последовательную задачу. Это важное различие для AAD: сглаживание после обучения не заменяет sequence-aware training.

Вариант, AVGC 1 с ESCNetCausal accuracyCausal delayNon-causal accuracyNon-causal delay
CE raw55.7%---
Post-HMM, fixed q77.5%9.3 с84.3%14.4 с
Post-HMM, learned q78.0%10.4 с84.3%12.8 с
CE + CRF, fixed q86.0%21.8 с92.2%17.3 с
CE + CRF, learned q86.5%23.3 с92.4%17.4 с

Как это читать: learned q почти не объясняет прирост, потому что post-HMM с learned q остается около 78% causal. Настоящий скачок появляется, когда сам backbone обучается с CRF-целью, но этот скачок покупается более инертным переключением.

Оригинальная статья на arXiv