нейродекодирование речи МЭГ набор данных
arXiv cs.LG

LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale

arXiv:2608.25204

LibriBrain100 важен не рекордом нейронного декодирования, а устройством данных: около 80 из 104 часов МЭГ записаны у одного слушателя, а еще 32 участника добавляют ширину популяции. Авторы прямо проверяют, может ли глубокая запись одного человека помочь моделям переноситься на людей, у которых доступно лишь 10–40 минут данных.

Метод. Набор содержит 306-канальную МЭГ при пассивном прослушивании аудиокниг Sherlock, фрагментов TIMIT и MOCHA-TIMIT и подкастов The Moth. Сырые данные доступны в BIDS с частотой 1 кГц, подготовленные — в HDF5 float32 с частотой 250 Гц; приложены стандартные разбиения и принудительное выравнивание речи. Проверочный опыт использует MEG-XL и сбалансированную классификацию 50 слов с top-10 точностью, где случайный уровень равен 0,2.

Результаты. На совокупности участников 1–32 добавление глубоких данных участника 0 повышает точность с 0,329 до 0,478, p<0,001. При сокращении индивидуальных данных нового участника с примерно 40 до 20 и 10 минут качество с глубоким участником почти не меняется: 0,492, 0,488 и 0,482. Без него значения остаются около 0,33. Таким образом, примерно 80 часов одного человека дают около 15 процентных пунктов переноса, хотя у каждого целевого участника данных примерно в 120 раз меньше.

Ограничения. Это пассивное слушание здоровых добровольцев, а не внутренняя или воображаемая речь и не клинический нейроинтерфейс. Глубокая часть почти целиком принадлежит одному человеку, поэтому неизвестно, сохранится ли эффект при другом «опорном» участнике. Размер файлов исчисляется сотнями гигабайт, а приведенный опыт проверяет классификацию слов, не непрерывное восстановление текста.

Фишка из статьи. Уменьшение данных целевого человека в четыре раза почти не влияет на результат, если модель видит глубокую запись другого участника. Это редкая эмпирическая подсказка о том, как выгоднее распределять дорогой бюджет нейровизуализации.

Данные целевого участникаС глубокими данными участника 0Без участника 0
100% (около 40 мин)0,4920,334
50% (около 20 мин)0,4880,337
25% (около 10 мин)0,4820,332

Как это читать: вертикальный разрыв гораздо больше различий между 10, 20 и 40 минутами. В данном протоколе глубокая межсубъектная опора полезнее дополнительной получасовой записи каждого нового человека.

Оригинальная статья на arXiv