SoniSpeech: open-vocabulary silent speech через очки
SoniSpeech важна как датасетная работа для silent speech interfaces: открытый словарь обычно требует навязчивых электродов или громоздких датчиков, а здесь используются очки с ультразвуковым акустическим sensing. Корпус синхронизирует три модальности - ultrasonic echo profiles, voiced audio и frontal video - в voiced и silent режимах. Это делает задачу не игрушечной классификацией команд, а open-vocabulary распознаванием без звучащей речи.
Метод. Аппаратная платформа - frame очков с двумя speakers Ole Wolff OWR-05049T-38D и двумя ultrasound microphones Syntiant SPH0641LU4H-1 на нижних краях. Speakers излучают неслышимые FMCW chirps 18-28 кГц и 29-39 кГц с периодом 5 мс; движения лица и артикуляции меняют echo profile. Запись ведется с Teensy 4.0, custom audio board, MAX98357A amplifiers и ADAU7002 PDM-I2S converter на 100 кГц. Базовая модель - CTC ResNet-34 с greedy decoding, без внешней языковой модели.
Результаты. Датасет содержит 34.1 часа session-level data, 26.7 часа валидных utterance recordings, 18,000 utterances, 5,356 unique word types, 258,702 word tokens и 39/39 ARPABET phoneme coverage. Train/test: 8,000/1,000 sentences на модальность; voiced/silent sessions 180/180. Silent-only обучение дает 33.7% WER на silent evaluation, voiced-only на silent дает 78.4%, а combined voiced+silent снижает silent WER до 26.3%. На voiced evaluation combined модель получает 15.8% WER против 16.9% у voiced-only.
Ограничения. Это английский корпус с 360 sessions, и baseline специально простой. В тексте указано, что последние 20 silent sessions и 11 voiced sessions train split имели высокий noise level на одном микрофонном канале из-за hardware malfunction. Silent speech всего на 2.9% медленнее voiced, но артикуляционная динамика все равно отличается настолько, что voiced-only переносится плохо. Нет внешней языковой модели, speaker-independent сильных baseline и оценки работы вне лабораторного сценария ношения очков.
Фишка из статьи. Самый важный результат - cross-modal mismatch: voiced ultrasound не заменяет silent ultrasound, хотя сенсор тот же. Это хорошо показывает, что silent speech recognition нельзя решить простым предобучением на произнесенной вслух речи.
| Training data | Voiced eval WER | Silent eval WER | Что показывает |
|---|---|---|---|
| Voiced only | 16.9% | 78.4% | Хорошо для voiced, почти не переносится на silent |
| Silent only | 55.7% | 33.7% | Silent данные нужны напрямую |
| Voiced + Silent | 15.8% | 26.3% | Voiced данные полезны только вместе с silent |
Как это читать: combined training улучшает silent WER с 33.7% до 26.3%, но voiced-only дает 78.4%. Значит, ультразвуковой сигнал в silent режиме содержит другую артикуляционную статистику; будущие модели должны явно учить согласование voiced, silent, video и audio, а не надеяться на прямой перенос.