Паралингвистика SEA Speech
arXiv eess.AS

MERaLiON-GR: распознавание гендера по речи для английского и языков ЮВА

arXiv:2608.04433

MERaLiON-GR - прикладная, но полезная работа о распознавании гендера по речи для английского и языков Юго-Восточной Азии. Интерес здесь не в самой бинарной классификации, а в том, что авторы проверяют перенос на несколько языков, публичные корпуса и собственные записи "в дикой среде". Отдельно они показывают, что явная паралингвистическая метка помогает аудио-языковой модели отвечать на вопросы о речи.

Метод. Модель использует MERaLiON-SpeechEncoder-2 как речевой кодировщик, LoRA-настройку с rank 16, scaling 16 и dropout 0.05, а сверху - ECAPA-TDNN-классификатор. Для сравнения берутся Vox-Profile и универсальная Audio-LLM. Во второй части эксперимента предсказанный гендер подается Audio-LLM как метаданные вместе со звуком, то есть авторы проверяют не только отдельный классификатор, но и пользу такого признака для речевого понимания.

Результаты. На публичных наборах MERaLiON-GR выигрывает у Vox-Profile в 12 из 15 случаев и совпадает на Khmer FLEURS. Например, на English FLEURS модель дает 100.00% точности против 99.69 у Vox-Profile и 49.61 у Audio-LLM; на Vietnamese Common Voice - 99.22 против 96.08 и 36.08. Есть и просадки: Malay SMALDUSC дает 93.20 против 97.60 у Vox-Profile, Thai SER - 87.23 против 89.32. На внутренних сегментах 10-30 секунд модель также выше Vox-Profile: Malay 90.88 против 86.56, Tamil 94.73 против 90.57.

Ограничения. Работа оперирует гендерной меткой как классификационной категорией, поэтому вопросы этики, небинарных идентичностей и согласия пользователя требуют отдельной оценки. Два публичных корпуса показывают доменный провал относительно Vox-Profile, значит устойчивость к стилю речи и условиям записи еще не закрыта. Также метаданные улучшают ответы Audio-LLM, но это не заменяет аудита ошибок: уверенная неверная метка может системно портить последующую модель.

Фишка из статьи. Хороший инженерный результат - не только точность классификатора, а то, как явная речевая метка меняет поведение универсальной Audio-LLM.

НаборAudio-LLMMERaLiON-GRGR-AudioLLM с метаданными
English FLEURS49.61100.0097.31
Malay SMALDUSC57.1093.2098.30
Tamil Common Voice51.6094.0089.32
Vietnamese Common Voice36.0899.2296.08

Как это читать: Audio-LLM сама часто не извлекает нужный паралингвистический признак из звука, но становится намного лучше, когда получает его явно. Самый резкий скачок - Vietnamese Common Voice: +60.00 процентных пункта.

Оригинальная статья на arXiv