Easper: An Accessible ASR Pipeline for Language Documentation
Easper - не новая архитектура распознавания, а воспроизводимый рабочий процесс для полевого лингвиста: разметка из ELAN превращается в последовательные сеансы дообучения Whisper без написания кода. Исследовательская часть отвечает на важный вопрос холодного старта: какие записи размечать первыми, когда на язык есть от одного до пятнадцати часов материала.
Метод. Система импортирует сегменты ELAN, запускает Whisper-small в Google Colab и после каждого размеченного сеанса полностью дообучает модель три эпохи. Сравниваются пять правил выбора следующей записи: случайный порядок, высокий SNR, малое перекрытие речи, высокий показатель типов к токенам и высокий нормализованный показатель токенов к типам, то есть больше фонетико-лексического повторения. Проверка охватывает бислама, нафсан и нгуна.
Результаты. Для бислама собрано 13 ч 45 мин и 11 575 сегментов, для нафсан - 14 ч 50 мин и 9 245, для нгуна - только 1 ч 01 мин и 1 098. Стратегия нормализованного отношения токенов к типам обычно дает лучшую CER на ранних этапах, тогда как выбор чистого звука по SNR не лидирует. По графикам примерно после 150 минут бислама CER составляет около 15,5% у стратегии повторения против 25% у SNR; для нафсан - около 25,5% против 28,5%. На нгуна различия быстро сходятся к 9-10% после 50 минут.
Ограничения. Языков всего три, причем нгуна представлен одним часом; тесты малы - 30 минут для бислама и нафсан и 10 минут для нгуна. Числа ранних траекторий считываются с графика, доверительных интервалов и повторных запусков нет. Полное последовательное дообучение чувствительно к порядку сеансов: резкие скачки CER похожи на катастрофическое забывание. Поэтому вывод авторов корректно формулировать как тенденцию, а не универсальное правило отбора.
Фишка из статьи. Акустически чистая запись не обязательно является лучшей первой инвестицией разметочного времени: богатое повторение дает модели больше повторных встреч с теми же звуковыми и письменными единицами.
| Язык и ранняя точка | Повторение, CER | Высокий SNR, CER | Случайно, CER |
|---|---|---|---|
| Бислама, около 150 мин | примерно 15,5% | примерно 25,0% | примерно 22,3% |
| Нафсан, около 150 мин | примерно 25,5% | примерно 28,5% | примерно 32,5% |
| Нгуна, около 12 мин | примерно 13,8% | примерно 17% | примерно 15% |
Как это читать: значения приблизительные, поскольку статья дает кривые, а не таблицу. Тем не менее направление устойчиво в трех историях обучения: на малом бюджете повторяемость полезнее простого отбора по чистоте, а после накопления данных различия между стратегиями сокращаются.