EEG foundation models пока не переносятся на speech decoding
Эта работа ценна отрицательным результатом: большие EEG foundation models, успешные на motor imagery, sleep staging и seizure detection, не дают устойчивого выигрыша на декодировании речи. Авторы сравнивают LaBraM и EEGMamba с компактными сверточными baseline-моделями на overt, covert и imagined speech. Главный вывод строгий и практичный: общая предобученная EEG-репрезентация пока не переносится на speech production лучше, чем маленький EEGNet.
Метод. Бенчмарк включает UGR-MINDVOICE с overt/covert Iberian Spanish и BCI Competition 2020 Track 3 с imagined speech на английском. Сравниваются EEGNet, ShallowFBCSPNet, EEGConformer, LaBraM-Base и EEGMamba под единым preprocessing и fine-tuning protocol. Для UGR-MINDVOICE оцениваются три уровня сложности: speech mode, semantic category и word identity; для BCIC2020-T3 - within-subject и leave-one-subject-out протоколы.
Результаты. На UGR-MINDVOICE speech-mode EEGNet с 16.6K параметров дает accuracy 61.3%, выше LaBraM 57.3% и EEGMamba 56.6%. На semantic-category задача почти у chance 16.7%: EEGNet 19.9%, EEGMamba 19.3%, LaBraM 17.0%. На word identity chance 1.7%, и все модели фактически рядом с ним: EEGNet 2.8%, EEGMamba 2.9%, LaBraM 1.9%. На BCIC2020-T3 лучший within-subject balanced accuracy у EEGConformer - 30.2% при chance 20%, а в leave-one-subject-out все модели остаются около chance.
Ограничения. В обоих корпусах всего по 15 участников, а EEG-декодирование речи само по себе низкосигнальная задача. Результат не говорит, что foundation models бесполезны вообще; он говорит, что текущие публичные LaBraM и EEGMamba без speech-specific pretraining не дают преимущества в этой постановке. Также работа не касается инвазивных интерфейсов, где сигнал моторной коры для речи намного богаче.
Фишка из статьи. Сильнее всего цепляет масштаб отрицательного результата: модели в сотни раз крупнее не обгоняют 16K-parameter CNN даже на самой простой speech-mode задаче.
| Модель | Params | Speech mode Acc | Semantic Acc | Word Acc |
|---|---|---|---|---|
| EEGNet | 16.6K | 61.3% | 19.9% | 2.8% |
| LaBraM-Base | 5.8M | 57.3% | 17.0% | 1.9% |
| EEGMamba | 8.3M | 56.6% | 19.3% | 2.9% |
| Chance | - | 33.3% | 16.7% | 1.7% |
Как это читать: foundation models немного выше chance на speech mode, но ниже EEGNet; на лексических задачах все почти упирается в chance. Это редкий полезный negative result: перед разработкой speech-specific EEG foundation model нужен другой предобучающий сигнал, а не просто больше общих EEG-часов.