Персонализированное распознавание речи человека с дизартрией и трахеостомой на искусственных диалогах
Работа строит практически пригодное распознавание для одного чешского говорящего с тяжёлой дизартрией и постоянной трахеостомой, чью речь неподготовленные слушатели почти не понимают. Интерес здесь не в универсальной модели, а в полном персональном тракте: сбор 33 часов через искусственные диалоги, имитация трахеостомической речи, адаптация к телефону и потоковые подсказки.
Метод. Whisper Base последовательно дообучается на обычной чешской речи, акустически смоделированной трахеостомической речи, офлайн-записях конкретного человека и данных со смартфона. Во время вывода применяются персональный VAD и словарные подсказки. Проверка разделена на сценарные диалоги, ответы на вопросы и свободный разговор, что позволяет отделить запоминание шаблонов от переноса языковой модели.
Результаты. Нулевая Whisper даёт CER 0,944/0,882/1,529, а полная система — 0,433/0,449/0,637 для сценарного диалога, вопросов и спонтанной речи. Модель, обученная только на говорящем, почти равна полной на сценариях, но заметно хуже в спонтанной речи: 0,949. На отдельном наборе полная система с CER 0,565 превзошла средний результат четырёх помощников 0,708, хотя лучший знакомый с данными слушатель остался впереди с 0,423.
Ограничения. Это исследование одного человека, одного языка и специфического устройства; перенос на других людей с дизартрией не показан. Абсолютная ошибка в свободном разговоре всё ещё высока. Некоторые тестовые подмножества малы, а сравнение с помощниками лишено визуального и интерактивного контекста, которым люди обычно пользуются в разговоре.
Фишка из статьи. Главные улучшения дают не более сложная акустическая имитация и не дистилляция, а эксплуатационные компоненты: адаптация к обработке iPhone, VAD и словарное сопровождение. Ручные границы показывают, что примерно пятая часть ошибки свободного разговора связана только с сегментацией.
| Конфигурация | Сценарий CER | Вопросы CER | Спонтанная речь CER | Среднее |
|---|---|---|---|---|
| Полная система | 0,433 | 0,449 | 0,637 | 0,506 |
| Без адаптации к устройству | 0,637 | 0,637 | 0,696 | 0,657 |
| Без персонального VAD | 0,574 | 0,588 | 0,793 | 0,652 |
| Без словарных подсказок | 0,572 | 0,583 | 0,763 | 0,639 |
| Ручная сегментация | 0,409 | 0,416 | 0,506 | 0,444 |
Как это читать: после персонализации узкое место смещается из акустической модели в условия устройства и потоковую обвязку. Для вспомогательной технологии эти компоненты оказываются важнее нескольких общих приёмов обучения.