Silent speech Dataset WER
Silent speech interfaces

SoniSpeech: open-vocabulary silent speech через очки

26.3% WER

SoniSpeech важна как датасетная работа для silent speech interfaces: открытый словарь обычно требует навязчивых электродов или громоздких датчиков, а здесь используются очки с ультразвуковым акустическим sensing. Корпус синхронизирует три модальности - ultrasonic echo profiles, voiced audio и frontal video - в voiced и silent режимах. Это делает задачу не игрушечной классификацией команд, а open-vocabulary распознаванием без звучащей речи.

Метод. Аппаратная платформа - frame очков с двумя speakers Ole Wolff OWR-05049T-38D и двумя ultrasound microphones Syntiant SPH0641LU4H-1 на нижних краях. Speakers излучают неслышимые FMCW chirps 18-28 кГц и 29-39 кГц с периодом 5 мс; движения лица и артикуляции меняют echo profile. Запись ведется с Teensy 4.0, custom audio board, MAX98357A amplifiers и ADAU7002 PDM-I2S converter на 100 кГц. Базовая модель - CTC ResNet-34 с greedy decoding, без внешней языковой модели.

Результаты. Датасет содержит 34.1 часа session-level data, 26.7 часа валидных utterance recordings, 18,000 utterances, 5,356 unique word types, 258,702 word tokens и 39/39 ARPABET phoneme coverage. Train/test: 8,000/1,000 sentences на модальность; voiced/silent sessions 180/180. Silent-only обучение дает 33.7% WER на silent evaluation, voiced-only на silent дает 78.4%, а combined voiced+silent снижает silent WER до 26.3%. На voiced evaluation combined модель получает 15.8% WER против 16.9% у voiced-only.

Ограничения. Это английский корпус с 360 sessions, и baseline специально простой. В тексте указано, что последние 20 silent sessions и 11 voiced sessions train split имели высокий noise level на одном микрофонном канале из-за hardware malfunction. Silent speech всего на 2.9% медленнее voiced, но артикуляционная динамика все равно отличается настолько, что voiced-only переносится плохо. Нет внешней языковой модели, speaker-independent сильных baseline и оценки работы вне лабораторного сценария ношения очков.

Фишка из статьи. Самый важный результат - cross-modal mismatch: voiced ultrasound не заменяет silent ultrasound, хотя сенсор тот же. Это хорошо показывает, что silent speech recognition нельзя решить простым предобучением на произнесенной вслух речи.

Training dataVoiced eval WERSilent eval WERЧто показывает
Voiced only16.9%78.4%Хорошо для voiced, почти не переносится на silent
Silent only55.7%33.7%Silent данные нужны напрямую
Voiced + Silent15.8%26.3%Voiced данные полезны только вместе с silent

Как это читать: combined training улучшает silent WER с 33.7% до 26.3%, но voiced-only дает 78.4%. Значит, ультразвуковой сигнал в silent режиме содержит другую артикуляционную статистику; будущие модели должны явно учить согласование voiced, silent, video и audio, а не надеяться на прямой перенос.

Оригинальная статья на arXiv