нейроинтерфейсы синтез речи реальное время
arXiv eess.AS

Brain2Speech-Net: Intelligible, Real-Time Brain-to-Speech Synthesis Without Text Decoding

arXiv:2609.04455

Brain2Speech-Net напрямую превращает сигналы коры при попытке говорить в звуковую речь, не выводя промежуточную строку текста. Фонемные вероятности всё же используются как обучаемое узкое место, но дифференцируемое HMM-выравнивание передаёт их в VITS-подобный синтезатор одной цепочкой.

Метод. Нейронный декодер оценивает фонемы из внутрикорковых записей, HMM мягко согласует их по времени, а условный генератор восстанавливает речь. Сравнение включает каскад «нейросигнал → текст → синтез», тот же каскад с языковым исправлением и дискретные речевые единицы. Оцениваются закрытый и открытый словари.

Результаты. В закрытом режиме Brain2Speech получает WER 6,8%, MCD 4,632 и RTF 0,504; каскад с LLM точнее по словам, 4,2%, но медленнее, RTF 1,714. В открытом режиме прямой метод ухудшается до WER 47,2% и MCD 5,522, тогда как каскад с LLM достигает 20,6%. Субъективная оценка прямой речи в открытом режиме около 3,34 против 1,57 у варианта с дискретными единицами.

Ограничения. Данные принадлежат одному участнику, а целевой звук частично создаётся синтетически. Открытый словарь выявляет большой разрыв по содержанию; личность голоса и естественная просодия почти не восстановлены. «Реальное время» измерено вычислительно и не включает полный нейрохирургический и потоковый тракт.

Фишка из статьи. Отказ от текстового шага выигрывает в скорости и звучании, но не в открытой точности содержания.

СистемаЗакрытый WER, %Открытый WER, %RTF
Каскад5,922,91,664–1,846
Каскад + LLM4,220,61,714–1,962
Дискретные единицы101,1105,40,056–0,060
Brain2Speech-Net6,847,20,504–0,532

Как это читать: в закрытом словаре прямой синтез почти достигает каскада и работает быстрее реального времени. В открытом словаре его WER более чем удваивается относительно каскада, поэтому текстовый контроль пока остаётся сильнее для неизвестных фраз.

Оригинальная статья на arXiv