Garhwali ASR: почему пять seed важнее новой функции потерь
Эта работа ценна не новой архитектурой, а дисциплиной оценки низкоресурсного распознавания речи. На Garhwali авторы показывают, что однослучайный запуск может легко создать иллюзию преимущества новой функции потерь или переноса с Hindi. Главная мысль: при 8.8 часа обучающей речи variance между seed становится частью результата, а не шумом, который можно игнорировать.
Метод. Авторы используют официальный split Vaani Garhwali, 450 тестовых фраз и пять случайных инициализаций для каждого условия. Сравниваются стандартная CTC-функция потерь, focal CTC, matra-weighted вариант и перенос с Hindi. Результаты сопровождаются стандартными отклонениями, bootstrap-интервалами, Wilcoxon/t-тестами и Holm-поправкой, а также анализом мощности.
Результаты. Стандартная CTC без аугментации дает WER 48.10±0.74, с аугментацией - 47.02±0.61. Focal CTC с аугментацией получает 47.83±0.68, matra-weighted - 47.42±0.78; статистически значимых различий между вариантами нет. Hindi transfer дает средний WER 47.22±0.91 против 47.02±0.61 у direct обучения; перенос помогает на двух seed и ухудшает на трех, p=0.81 по Wilcoxon.
Ограничения. Выводы относятся к одному корпусу и одному языку, а пять seed все еще мало для тонких эффектов. Работа не решает вопросы доменной устойчивости, диалектного покрытия и реального deployment. Но как методологический сигнал она сильная: заявлять улучшение в low-resource режиме без нескольких запусков рискованно.
Фишка из статьи. Главная фишка - таблица мощности: многие видимые различия слишком малы, чтобы надежно ловиться пятью seed.
| Сравнение | Разница WER | Мощность при 5 seed / n для 80% |
|---|---|---|
| Standard CTC против Focal CTC | +0.81 | 0.39 / 11 |
| Standard CTC против Matra-weighted | +0.40 | 0.21 / 20 |
| Focal CTC против Matra-weighted | -0.42 | 0.34 / 12 |
Как это читать: если ожидаемый выигрыш меньше одного процентного пункта WER, пять запусков часто недостаточны. Для низкоресурсной речи лучше сначала посчитать надежность вывода, а уже потом обсуждать новую функцию потерь как улучшение.