Age-aware phoneme recognition: детская речь на устройстве
Статья короткая, но полезная для темы детской речи: авторы пытаются сделать фонемное распознавание достаточно компактным для запуска на устройстве. Вместо ансамбля больших моделей они используют вспомогательное предсказание возрастной группы ребенка. Главная идея - заставить акустический кодировщик учитывать возрастную вариативность, которая у детей особенно сильно влияет на произношение и длительности фонем.
Метод. Модель строится на wav2vec2/XLS-R и обучается CTC-головой для фонем, а дополнительная голова предсказывает возрастную корзину: 3-4, 5-7, 8-11 или 12+ лет. Данные объединяют DrivenData и TalkBank, всего 117 500 фрагментов, причем split делается по child ID, чтобы один ребенок не попадал одновременно в обучение и проверку. Авторы сравнивают компактный Base+ на 94 млн параметров с Large на 317 млн параметров и RNN-T вариантом.
Результаты. Главное число: Base+ без возрастной головы имеет CER 0.656 на смешанной валидации, а Base+ с age-aware обучением - 0.316. Это почти двукратное улучшение при той же компактной базе. Large CTC получает CER 0.358, Large RNN-T - 0.306; то есть возрастная подсказка позволяет маленькой модели приблизиться к более крупной. В статье также приводится контекст соревнования: победивший ансамбль из 13 моделей на 317 млн-1.5 млрд параметров дал CER 0.2607 на скрытом наборе, но требовал A100 80GB.
Ограничения. Это демонстрационная, а не полноценная архивная статья: мало деталей о задержке, памяти и реальном устройстве. Возрастная голова сама по себе распознает возраст только с accuracy 72% и в основном тяготеет к доминирующему классу, поэтому механизм улучшения остается гипотезой. Нет проверки на широком наборе языков и акцентов.
Фишка из статьи. Интересная отрицательная деталь: вспомогательная задача полезна даже тогда, когда она не очень хорошо решается как отдельная классификация возраста.
| Модель | Смешанный CER | Размер/смысл |
|---|---|---|
| Base+ CTC | 0.656 | 94 млн параметров, без возраста |
| Base+ CTC + возраст | 0.316 | тот же масштаб, большая прибавка |
| Large CTC | 0.358 | 317 млн параметров |
| Large RNN-T | 0.306 | лучшее среди одиночных моделей статьи |
Как это читать: возрастная метка здесь работает скорее как регуляризатор представления, а не как надежный самостоятельный предсказатель. Для детской речи это важная подсказка: метаданные могут быть дешевле, чем рост модели.