Распознавание речи Low-resource Оценка
arXiv cs.CL

Garhwali ASR: почему пять seed важнее новой функции потерь

arXiv:2608.10670

Эта работа ценна не новой архитектурой, а дисциплиной оценки низкоресурсного распознавания речи. На Garhwali авторы показывают, что однослучайный запуск может легко создать иллюзию преимущества новой функции потерь или переноса с Hindi. Главная мысль: при 8.8 часа обучающей речи variance между seed становится частью результата, а не шумом, который можно игнорировать.

Метод. Авторы используют официальный split Vaani Garhwali, 450 тестовых фраз и пять случайных инициализаций для каждого условия. Сравниваются стандартная CTC-функция потерь, focal CTC, matra-weighted вариант и перенос с Hindi. Результаты сопровождаются стандартными отклонениями, bootstrap-интервалами, Wilcoxon/t-тестами и Holm-поправкой, а также анализом мощности.

Результаты. Стандартная CTC без аугментации дает WER 48.10±0.74, с аугментацией - 47.02±0.61. Focal CTC с аугментацией получает 47.83±0.68, matra-weighted - 47.42±0.78; статистически значимых различий между вариантами нет. Hindi transfer дает средний WER 47.22±0.91 против 47.02±0.61 у direct обучения; перенос помогает на двух seed и ухудшает на трех, p=0.81 по Wilcoxon.

Ограничения. Выводы относятся к одному корпусу и одному языку, а пять seed все еще мало для тонких эффектов. Работа не решает вопросы доменной устойчивости, диалектного покрытия и реального deployment. Но как методологический сигнал она сильная: заявлять улучшение в low-resource режиме без нескольких запусков рискованно.

Фишка из статьи. Главная фишка - таблица мощности: многие видимые различия слишком малы, чтобы надежно ловиться пятью seed.

СравнениеРазница WERМощность при 5 seed / n для 80%
Standard CTC против Focal CTC+0.810.39 / 11
Standard CTC против Matra-weighted+0.400.21 / 20
Focal CTC против Matra-weighted-0.420.34 / 12

Как это читать: если ожидаемый выигрыш меньше одного процентного пункта WER, пять запусков часто недостаточны. Для низкоресурсной речи лучше сначала посчитать надежность вывода, а уже потом обсуждать новую функцию потерь как улучшение.

Оригинальная статья на arXiv