Синтез речи EMG Нейроинтерфейсы
EMG-to-Speech

EMG-to-Speech: качество лучше, но WER еще около 41%

WER 41.26%

Статья про EMG-to-Speech, то есть синтез слышимой речи по мышечным сигналам артикуляции. Это нишевая, но важная ветка речевых технологий для silent speech interfaces: качество пока далеко от обычного TTS, зато задача не требует акустического входа. Авторы предлагают Samba-based encoder, две нелинейные потери и post-vocoder alignment, чтобы наконец считать не только WER, но и акустические метрики после vocoder-а.

Метод. CS-ETS строится вокруг CFE-блока и Mamba/Samba-подобного sequence encoder, после чего акустические признаки восстанавливаются через HiFi-GAN vocoder. Новые функции потерь используют Lyapunov Exponent Ratio и multi-scale detrended fluctuation analysis: они должны штрафовать потерю нелинейной динамики EMG-сигнала, которую обычные L1/MSE плохо видят. Post-vocoder alignment выравнивает синтезированный и целевой waveform, чтобы frame-level метрики вроде LSD, STOI, PESQ и SI-SDR не ломались из-за временного сдвига vocoder-а.

Результаты. По сравнению с Gaddy et al. 2021 модель снижает параметры с 54.10M до 32.03M и WER с 42.20% до 41.26%. Акустические метрики меняются сильнее: LSD 2.25 -> 1.07, STOI 0.13 -> 0.61, SI-SDR -41.96 -> -33.41, NISQA-MOS 3.30 -> 3.31. Вычислительно модель также легче: encoder parameters 44.03M -> 21.96M, FLOPs 2.40G -> 2.08G, measured inference time 5.97 -> 5.55 мс при одинаковом RTF 0.0057. Авторы также сообщают MOS 4.21 против 3.98 у baseline.

Ограничения. Абсолютный WER около 41% остается высоким, поэтому это не готовая замена обычному распознаванию или TTS. PESQ около 1.19 тоже показывает, что сигнал далек от естественной речи. Часть выигрышей зависит от post-vocoder alignment, а сравнение идет с ограниченным набором старых ETS-baselines; утверждения про chaos-inspired losses стоит читать как инженерную гипотезу, а не доказанную физиологическую модель.

Фишка из статьи. Абляция показывает разные роли alignment и нелинейных потерь. PVA резко улучшает frame-level качество, но без LER/MSDFA WER остается плохим; полная модель жертвует частью SI-SDR ради лучшей распознаваемости.

КонфигурацияLSDSTOISI-SDRWER
Gaddy et al. 20212.250.13-41.9642.20%
CS-ETS без PVA+LER+MSDFA1.920.15-36.9050.37%
CS-ETS с PVA, без LER+MSDFA1.100.61-31.3050.37%
Полный CS-ETS1.070.61-33.4141.26%

Как это читать: alignment нужен, чтобы метрики качества вообще стали интерпретируемыми, но сам по себе он не улучшает лингвистическую точность. Потери LER/MSDFA в этой постановке дают основной возврат WER к уровню baseline при меньшей модели.

Оригинальная статья на arXiv