EMG-to-Speech: качество лучше, но WER еще около 41%
Статья про EMG-to-Speech, то есть синтез слышимой речи по мышечным сигналам артикуляции. Это нишевая, но важная ветка речевых технологий для silent speech interfaces: качество пока далеко от обычного TTS, зато задача не требует акустического входа. Авторы предлагают Samba-based encoder, две нелинейные потери и post-vocoder alignment, чтобы наконец считать не только WER, но и акустические метрики после vocoder-а.
Метод. CS-ETS строится вокруг CFE-блока и Mamba/Samba-подобного sequence encoder, после чего акустические признаки восстанавливаются через HiFi-GAN vocoder. Новые функции потерь используют Lyapunov Exponent Ratio и multi-scale detrended fluctuation analysis: они должны штрафовать потерю нелинейной динамики EMG-сигнала, которую обычные L1/MSE плохо видят. Post-vocoder alignment выравнивает синтезированный и целевой waveform, чтобы frame-level метрики вроде LSD, STOI, PESQ и SI-SDR не ломались из-за временного сдвига vocoder-а.
Результаты. По сравнению с Gaddy et al. 2021 модель снижает параметры с 54.10M до 32.03M и WER с 42.20% до 41.26%. Акустические метрики меняются сильнее: LSD 2.25 -> 1.07, STOI 0.13 -> 0.61, SI-SDR -41.96 -> -33.41, NISQA-MOS 3.30 -> 3.31. Вычислительно модель также легче: encoder parameters 44.03M -> 21.96M, FLOPs 2.40G -> 2.08G, measured inference time 5.97 -> 5.55 мс при одинаковом RTF 0.0057. Авторы также сообщают MOS 4.21 против 3.98 у baseline.
Ограничения. Абсолютный WER около 41% остается высоким, поэтому это не готовая замена обычному распознаванию или TTS. PESQ около 1.19 тоже показывает, что сигнал далек от естественной речи. Часть выигрышей зависит от post-vocoder alignment, а сравнение идет с ограниченным набором старых ETS-baselines; утверждения про chaos-inspired losses стоит читать как инженерную гипотезу, а не доказанную физиологическую модель.
Фишка из статьи. Абляция показывает разные роли alignment и нелинейных потерь. PVA резко улучшает frame-level качество, но без LER/MSDFA WER остается плохим; полная модель жертвует частью SI-SDR ради лучшей распознаваемости.
| Конфигурация | LSD | STOI | SI-SDR | WER |
|---|---|---|---|---|
| Gaddy et al. 2021 | 2.25 | 0.13 | -41.96 | 42.20% |
| CS-ETS без PVA+LER+MSDFA | 1.92 | 0.15 | -36.90 | 50.37% |
| CS-ETS с PVA, без LER+MSDFA | 1.10 | 0.61 | -31.30 | 50.37% |
| Полный CS-ETS | 1.07 | 0.61 | -33.41 | 41.26% |
Как это читать: alignment нужен, чтобы метрики качества вообще стали интерпретируемыми, но сам по себе он не улучшает лингвистическую точность. Потери LER/MSDFA в этой постановке дают основной возврат WER к уровню baseline при меньшей модели.