персонализированное распознавание речи дизартрия доступность
arXiv cs.AI

Персонализированное распознавание речи человека с дизартрией и трахеостомой на искусственных диалогах

arXiv:2610.03017

Работа строит практически пригодное распознавание для одного чешского говорящего с тяжёлой дизартрией и постоянной трахеостомой, чью речь неподготовленные слушатели почти не понимают. Интерес здесь не в универсальной модели, а в полном персональном тракте: сбор 33 часов через искусственные диалоги, имитация трахеостомической речи, адаптация к телефону и потоковые подсказки.

Метод. Whisper Base последовательно дообучается на обычной чешской речи, акустически смоделированной трахеостомической речи, офлайн-записях конкретного человека и данных со смартфона. Во время вывода применяются персональный VAD и словарные подсказки. Проверка разделена на сценарные диалоги, ответы на вопросы и свободный разговор, что позволяет отделить запоминание шаблонов от переноса языковой модели.

Результаты. Нулевая Whisper даёт CER 0,944/0,882/1,529, а полная система — 0,433/0,449/0,637 для сценарного диалога, вопросов и спонтанной речи. Модель, обученная только на говорящем, почти равна полной на сценариях, но заметно хуже в спонтанной речи: 0,949. На отдельном наборе полная система с CER 0,565 превзошла средний результат четырёх помощников 0,708, хотя лучший знакомый с данными слушатель остался впереди с 0,423.

Ограничения. Это исследование одного человека, одного языка и специфического устройства; перенос на других людей с дизартрией не показан. Абсолютная ошибка в свободном разговоре всё ещё высока. Некоторые тестовые подмножества малы, а сравнение с помощниками лишено визуального и интерактивного контекста, которым люди обычно пользуются в разговоре.

Фишка из статьи. Главные улучшения дают не более сложная акустическая имитация и не дистилляция, а эксплуатационные компоненты: адаптация к обработке iPhone, VAD и словарное сопровождение. Ручные границы показывают, что примерно пятая часть ошибки свободного разговора связана только с сегментацией.

КонфигурацияСценарий CERВопросы CERСпонтанная речь CERСреднее
Полная система0,4330,4490,6370,506
Без адаптации к устройству0,6370,6370,6960,657
Без персонального VAD0,5740,5880,7930,652
Без словарных подсказок0,5720,5830,7630,639
Ручная сегментация0,4090,4160,5060,444

Как это читать: после персонализации узкое место смещается из акустической модели в условия устройства и потоковую обвязку. Для вспомогательной технологии эти компоненты оказываются важнее нескольких общих приёмов обучения.

Оригинальная статья на arXiv