Верификация говорящего Classroom EER
Верификация говорящего

Верификация говорящего в реальных классах: WavLM-TDNN против шума

EER 15.40%

Статья полезна тем, что переносит верификацию говорящего из относительно чистых наборов в реальные школьные классы: дети и взрослые говорят поверх фонового говора, шума и разных акустических условий. Авторы проверяют, помогает ли фронтенд WavLM-large с TDNN-бэкендом там, где классический ECAPA-TDNN обучен в основном на взрослой речи. Практический смысл прямой: образовательные системы часто должны понимать, кто говорит, без студийной записи и полной разметки.

Метод. Используется in-house EDSI dataset: 18 англоязычных классов 6-8 классов, 4.31 часа enrollment-записей от 402 говорящих и около 218 часов классных аудиозаписей. Только часть данных размечена по speaker ID: 2694 высказывания и 216 уникальных говорящих. WavLM-TDNN обучается в два этапа: сначала self-supervised MoCo на неразмеченных фрагментах, затем supervised fine-tuning на ограниченной разметке с cross-entropy, AAM-Softmax и semi-hard triplet loss.

Результаты. Двухэтапное обучение снижает средний EER с 17.78% у SSL-only до 15.40%. В сравнении моделей ECAPA-TDNN base дает 20.26% EER, ECAPA-TDNN после адаптации на классных данных - 16.44%, а WavLM-TDNN - 15.40%. На маленьком multilingual classroom тесте из 120 высказываний и 29 минут WavLM-TDNN получает 15.89% EER против 16.82% у адаптированного ECAPA-TDNN и 22.43% у base.

Ограничения. Данные закрытые и сильно доменно-специфичные: школьные классы, математика, ограниченный возрастной диапазон. Многоязычная проверка мала и скорее диагностическая, чем полноценная. Разметка speaker ID есть только у части записей, а аудио с пяти микрофонов усредняется в один сигнал, что может скрывать пространственную информацию, полезную для разделения говорящих.

Фишка из статьи. Главный численный результат не только в WavLM, а в двухступенчатом протоколе: self-supervised pretraining на доменном шуме без меток заметно выигрывает только после небольшой supervised адаптации.

МетодFold 1Fold 2Fold 3Fold 4Fold 5Avg EER
SSL-only WavLM-TDNN18.2814.9117.7018.7419.2817.78
Two-stage WavLM-TDNN14.1411.8416.0116.6218.4115.40
ECAPA-TDNN base19.4817.5118.8021.7523.7520.26
ECAPA-TDNN adapted15.0812.9416.8117.8619.4916.44

Как это читать: разница между 16.44% и 15.40% EER невелика, но она стабильна по всем пяти fold. Для такого шумного и частично размеченного домена стабильность важнее одной красивой средней цифры.

Оригинальная статья на arXiv