распознавание речи прореживание моделей справедливость
arXiv cs.SD

Эффективность ценой справедливости: демографические различия после прореживания речевых языковых моделей

arXiv:2609.38106

Прореживание речевой языковой модели может улучшить средний WER и одновременно ухудшить распознавание группы, которая уже обслуживалась хуже остальных. Авторы показывают это на SLAM-ASR с кодировщиками Whisper трёх размеров: агрегированная метрика скрывает не просто разный масштаб потерь, а противоположное направление изменения.

Метод. Верхние слои кодировщика удаляются по два, после каждого шага модель обучается по одному протоколу без демографических меток. Результаты разбираются по этнической принадлежности, полу, возрасту, социально-экономическому положению и акценту на Fair-Speech и Common Voice; отдельно проверяется адаптация LoRA.

Результаты. После удаления двух слоёв Whisper large средний WER улучшается с 21,6 до 21,1%, но для темнокожих говорящих растёт с 27,2 до 28,1%, тогда как для азиатских снижается с 13,7 до 13,1%. После восьми удалённых слоёв разрыв между этими группами увеличивается с 13,5 до 24,5 процентного пункта. LoRA снижает ошибку всех групп, но отношение худшего WER к лучшему становится ещё больше.

Ограничения. Демографические категории заданы наборами данных и не описывают всех пересечений признаков. Исследуется последовательное удаление верхних слоёв одной системы, поэтому выводы нельзя автоматически переносить на разреживание весов или другие речевые архитектуры.

Фишка из статьи. Самый опасный режим возникает уже на первом шаге: средняя ошибка становится лучше, хотя худшая группа единственная статистически значимо ухудшается. Более глубокое прореживание заметно портит среднее и потому хотя бы не маскирует сам факт потери качества.

Удалено слоёвАзиатские говорящие, WER ↓Темнокожие говорящие, WER ↓Все данные, WER ↓Разрыв
013,7%27,2%21,6%13,5 п.п.
213,1%28,1%21,1%15,0 п.п.
826,5%51,0%37,6%24,5 п.п.

Как это читать: выбор модели только по среднему WER одобрил бы вариант с двумя удалёнными слоями, хотя именно он усиливает исходное неравенство незаметно для средней метрики.

Оригинальная статья на arXiv