распознавание речи контекст воспроизводимость
arXiv cs.CL

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

arXiv:2608.28875

Подсказка с именами, местами и темами кажется дешёвым способом приспособить распознавание речи к архиву, но в производственном опыте её влияние на общий WER обнаружить не удалось. Ценность работы — в заранее зарегистрированном отрицательном результате и разборе того, почему локально полезный контекст почти не виден в средней ошибке по кассетной стороне.

Метод. Авторы повторно обработали 19 сторон кассет, около 10,6 часа ухудшенных интервью 1970–1980-х годов, в трёх режимах подсказки и двух облачных конфигурациях: gpt-4o-transcribe и gemini-2.5-flash. Сравнение попарное внутри каждой стороны; гипотезы, код анализа и его контрольные суммы зафиксированы до основной оценки. Эталонные расшифровки исправлены оператором, а отдельное выравнивание проверяет фразы, буквально перечисленные в контексте.

Результаты. Для gpt-4o-transcribe медианная разность «полный контекст минус без контекста» составляет +0,6 процентного пункта WER с интервалом [−1,1; +1,0], то есть измеримого улучшения нет. Ни одна из четырёх предварительно заявленных гипотез не подтверждена. На полностью перечисленных фразах ошибка снижается примерно с 29% до 23%, но такие фрагменты занимают лишь 1,2% эталона и дают около 0,07 пункта общего WER. Повторные запуски четырёх сторон менялись сильнее основного эффекта.

Ограничения. Корпус закрытый, содержит лишь 19 кассетных сторон и восемь интервьюируемых; это не проверка эквивалентности, поэтому малый полезный эффект не исключён. Облачные модели и версии их серверных конвейеров не контролируются, в основной серии есть только один запуск на ячейку. Эталонные черновики частично создавались моделью, а две системы различаются не только распознавателем.

Фишка из статьи. Это наглядный пример разбавления редкого эффекта: контекст действительно помогает словам, которые в нём перечислены, но их доля слишком мала, чтобы заметно сдвинуть WER всей записи. Одновременно случайность облачного конвейера сравнима с искомой разностью.

Уровень наблюденияОценка эффекта полного контекстаЧто ограничивает вывод
Вся сторона кассеты, GPT+0,6 п.п. WER; интервал [−1,1; +1,0]Нет обнаружимого выигрыша
Полностью перечисленные фразыошибка около 29% → 23%Только 1,2% слов эталона
Вклад перечисленных фраз в общий WERпримерно −0,07 п.п.Эффект разбавлен остальной записью
Повторные запуски четырёх сторонмедиана +0,2; IQR [−1,9; +2,7] п.п.Разброс больше основного эффекта

Как это читать: агрегатный WER отвечает на вопрос о всей расшифровке, но плохо чувствует редкие имена и устойчивые фразы. Для контекстного распознавания нужны одновременно общая ошибка, ошибки целевых терминов и повторные запуски.

Оригинальная статья на arXiv