Документация языков Распознавание речи Выбор данных
arXiv cs.CL

Easper: An Accessible ASR Pipeline for Language Documentation

arXiv:2608.11629

Easper - не новая архитектура распознавания, а воспроизводимый рабочий процесс для полевого лингвиста: разметка из ELAN превращается в последовательные сеансы дообучения Whisper без написания кода. Исследовательская часть отвечает на важный вопрос холодного старта: какие записи размечать первыми, когда на язык есть от одного до пятнадцати часов материала.

Метод. Система импортирует сегменты ELAN, запускает Whisper-small в Google Colab и после каждого размеченного сеанса полностью дообучает модель три эпохи. Сравниваются пять правил выбора следующей записи: случайный порядок, высокий SNR, малое перекрытие речи, высокий показатель типов к токенам и высокий нормализованный показатель токенов к типам, то есть больше фонетико-лексического повторения. Проверка охватывает бислама, нафсан и нгуна.

Результаты. Для бислама собрано 13 ч 45 мин и 11 575 сегментов, для нафсан - 14 ч 50 мин и 9 245, для нгуна - только 1 ч 01 мин и 1 098. Стратегия нормализованного отношения токенов к типам обычно дает лучшую CER на ранних этапах, тогда как выбор чистого звука по SNR не лидирует. По графикам примерно после 150 минут бислама CER составляет около 15,5% у стратегии повторения против 25% у SNR; для нафсан - около 25,5% против 28,5%. На нгуна различия быстро сходятся к 9-10% после 50 минут.

Ограничения. Языков всего три, причем нгуна представлен одним часом; тесты малы - 30 минут для бислама и нафсан и 10 минут для нгуна. Числа ранних траекторий считываются с графика, доверительных интервалов и повторных запусков нет. Полное последовательное дообучение чувствительно к порядку сеансов: резкие скачки CER похожи на катастрофическое забывание. Поэтому вывод авторов корректно формулировать как тенденцию, а не универсальное правило отбора.

Фишка из статьи. Акустически чистая запись не обязательно является лучшей первой инвестицией разметочного времени: богатое повторение дает модели больше повторных встреч с теми же звуковыми и письменными единицами.

Язык и ранняя точкаПовторение, CERВысокий SNR, CERСлучайно, CER
Бислама, около 150 минпримерно 15,5%примерно 25,0%примерно 22,3%
Нафсан, около 150 минпримерно 25,5%примерно 28,5%примерно 32,5%
Нгуна, около 12 минпримерно 13,8%примерно 17%примерно 15%

Как это читать: значения приблизительные, поскольку статья дает кривые, а не таблицу. Тем не менее направление устойчиво в трех историях обучения: на малом бюджете повторяемость полезнее простого отбора по чистоте, а после накопления данных различия между стратегиями сокращаются.

Оригинальная статья на arXiv