Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation
Средний WER по демографическим группам легко принять за признак несправедливости модели, хотя группы могли произносить разные по сложности фразы или состоять из нескольких особенно трудных говорящих. Эта статья предлагает отделять демографический эффект от содержания и индивидуальных особенностей с помощью смешанной регрессии, а семантическую сложность измерять внутренними представлениями самой проверяемой аудиоязыковой модели.
Метод. В распознавании речи вставки моделируются распределением Пуассона, а замены и удаления - биномиальным распределением с числом слов в эталоне. Демографическая группа входит как фиксированный эффект, говорящий как случайный эффект, а восьмимерная проекция смыслового представления фразы как дополнительный признак. Авторы извлекают это представление из Qwen2-Audio двумя способами: усредняют состояния первого, среднего и последнего слоёв либо используют логиты ответа на просьбу свести смысл к одному слову. Разрыв выражается отношением ожидаемых WER или оценок ответа; доверительный интервал, содержащий единицу, не подтверждает различие.
Результаты. В управляемом опыте пол не влияет на качество, но женщинам намеренно назначены более трудные вопросы. Простое сравнение даёт ложный разрыв 1,124 с 95%-м интервалом 1,103-1,144; после смысловой поправки отношение становится 1,003 или 1,000. На LibriSpeech Test-Clean исходное отношение мужского WER к женскому равно 0,719 и выглядит значимым, тогда как модель со случайным эффектом говорящего даёт 0,777 с интервалом 0,600-1,011, а полная модель - 0,802-0,822 с интервалами, включающими единицу. На Test-Other отношение снижается с 1,162 до 1,017-1,020. На AIR-Bench-Chat все варианты незначимы, но смысловая поправка сдвигает отношение оценок с 0,969 к 1,002-1,004.
Ограничения. Реальные опыты проведены только с Qwen2-Audio и бинарным признаком пола. В AIR-Bench-Chat всего 599 примеров с разметкой пола и нет идентификаторов говорящих, поэтому случайный эффект там неприменим. Семантический признак самой модели удобен, но может поглотить часть настоящего группового эффекта; регрессия устраняет измеренные смешивающие факторы, а не доказывает причинную нейтральность. Выбор восьми компонент PCA и распределений ошибок также требует проверки на других задачах.
Фишка из статьи. На двух стандартных частях LibriSpeech один и тот же наивный тест сообщает противоположные, но якобы значимые перекосы. Учёт говорящего уже снимает значимость, а смысловая поправка дополнительно приближает отношение к единице.
| Набор и способ | Отношение WER, муж./жен. | 95%-й интервал |
|---|---|---|
| Test-Clean, простое сравнение | 0,719 | 0,553-0,938 |
| Test-Clean, говорящий + смысл | 0,802 | 0,619-1,042 |
| Test-Other, простое сравнение | 1,162 | 1,013-1,329 |
| Test-Other, говорящий + смысл | 1,020 | 0,811-1,289 |
Как это читать: значение ниже единицы на Test-Clean формально благоприятствует мужчинам, а выше единицы на Test-Other - женщинам. После контроля обе оценки статистически совместимы с отсутствием разрыва, поэтому агрегированный WER здесь скорее отражает состав материала и говорящих, чем устойчивое действие пола.