Brain2Speech-Net: Intelligible, Real-Time Brain-to-Speech Synthesis Without Text Decoding
Brain2Speech-Net напрямую превращает сигналы коры при попытке говорить в звуковую речь, не выводя промежуточную строку текста. Фонемные вероятности всё же используются как обучаемое узкое место, но дифференцируемое HMM-выравнивание передаёт их в VITS-подобный синтезатор одной цепочкой.
Метод. Нейронный декодер оценивает фонемы из внутрикорковых записей, HMM мягко согласует их по времени, а условный генератор восстанавливает речь. Сравнение включает каскад «нейросигнал → текст → синтез», тот же каскад с языковым исправлением и дискретные речевые единицы. Оцениваются закрытый и открытый словари.
Результаты. В закрытом режиме Brain2Speech получает WER 6,8%, MCD 4,632 и RTF 0,504; каскад с LLM точнее по словам, 4,2%, но медленнее, RTF 1,714. В открытом режиме прямой метод ухудшается до WER 47,2% и MCD 5,522, тогда как каскад с LLM достигает 20,6%. Субъективная оценка прямой речи в открытом режиме около 3,34 против 1,57 у варианта с дискретными единицами.
Ограничения. Данные принадлежат одному участнику, а целевой звук частично создаётся синтетически. Открытый словарь выявляет большой разрыв по содержанию; личность голоса и естественная просодия почти не восстановлены. «Реальное время» измерено вычислительно и не включает полный нейрохирургический и потоковый тракт.
Фишка из статьи. Отказ от текстового шага выигрывает в скорости и звучании, но не в открытой точности содержания.
| Система | Закрытый WER, % | Открытый WER, % | RTF |
|---|---|---|---|
| Каскад | 5,9 | 22,9 | 1,664–1,846 |
| Каскад + LLM | 4,2 | 20,6 | 1,714–1,962 |
| Дискретные единицы | 101,1 | 105,4 | 0,056–0,060 |
| Brain2Speech-Net | 6,8 | 47,2 | 0,504–0,532 |
Как это читать: в закрытом словаре прямой синтез почти достигает каскада и работает быстрее реального времени. В открытом словаре его WER более чем удваивается относительно каскада, поэтому текстовый контроль пока остаётся сильнее для неизвестных фраз.