Детская речь Фонемы Edge
arXiv eess.AS

Age-aware phoneme recognition: детская речь на устройстве

arXiv:2608.10206

Статья короткая, но полезная для темы детской речи: авторы пытаются сделать фонемное распознавание достаточно компактным для запуска на устройстве. Вместо ансамбля больших моделей они используют вспомогательное предсказание возрастной группы ребенка. Главная идея - заставить акустический кодировщик учитывать возрастную вариативность, которая у детей особенно сильно влияет на произношение и длительности фонем.

Метод. Модель строится на wav2vec2/XLS-R и обучается CTC-головой для фонем, а дополнительная голова предсказывает возрастную корзину: 3-4, 5-7, 8-11 или 12+ лет. Данные объединяют DrivenData и TalkBank, всего 117 500 фрагментов, причем split делается по child ID, чтобы один ребенок не попадал одновременно в обучение и проверку. Авторы сравнивают компактный Base+ на 94 млн параметров с Large на 317 млн параметров и RNN-T вариантом.

Результаты. Главное число: Base+ без возрастной головы имеет CER 0.656 на смешанной валидации, а Base+ с age-aware обучением - 0.316. Это почти двукратное улучшение при той же компактной базе. Large CTC получает CER 0.358, Large RNN-T - 0.306; то есть возрастная подсказка позволяет маленькой модели приблизиться к более крупной. В статье также приводится контекст соревнования: победивший ансамбль из 13 моделей на 317 млн-1.5 млрд параметров дал CER 0.2607 на скрытом наборе, но требовал A100 80GB.

Ограничения. Это демонстрационная, а не полноценная архивная статья: мало деталей о задержке, памяти и реальном устройстве. Возрастная голова сама по себе распознает возраст только с accuracy 72% и в основном тяготеет к доминирующему классу, поэтому механизм улучшения остается гипотезой. Нет проверки на широком наборе языков и акцентов.

Фишка из статьи. Интересная отрицательная деталь: вспомогательная задача полезна даже тогда, когда она не очень хорошо решается как отдельная классификация возраста.

МодельСмешанный CERРазмер/смысл
Base+ CTC0.65694 млн параметров, без возраста
Base+ CTC + возраст0.316тот же масштаб, большая прибавка
Large CTC0.358317 млн параметров
Large RNN-T0.306лучшее среди одиночных моделей статьи

Как это читать: возрастная метка здесь работает скорее как регуляризатор представления, а не как надежный самостоятельный предсказатель. Для детской речи это важная подсказка: метаданные могут быть дешевле, чем рост модели.

Оригинальная статья на arXiv