Верификация говорящего в реальных классах: WavLM-TDNN против шума
Статья полезна тем, что переносит верификацию говорящего из относительно чистых наборов в реальные школьные классы: дети и взрослые говорят поверх фонового говора, шума и разных акустических условий. Авторы проверяют, помогает ли фронтенд WavLM-large с TDNN-бэкендом там, где классический ECAPA-TDNN обучен в основном на взрослой речи. Практический смысл прямой: образовательные системы часто должны понимать, кто говорит, без студийной записи и полной разметки.
Метод. Используется in-house EDSI dataset: 18 англоязычных классов 6-8 классов, 4.31 часа enrollment-записей от 402 говорящих и около 218 часов классных аудиозаписей. Только часть данных размечена по speaker ID: 2694 высказывания и 216 уникальных говорящих. WavLM-TDNN обучается в два этапа: сначала self-supervised MoCo на неразмеченных фрагментах, затем supervised fine-tuning на ограниченной разметке с cross-entropy, AAM-Softmax и semi-hard triplet loss.
Результаты. Двухэтапное обучение снижает средний EER с 17.78% у SSL-only до 15.40%. В сравнении моделей ECAPA-TDNN base дает 20.26% EER, ECAPA-TDNN после адаптации на классных данных - 16.44%, а WavLM-TDNN - 15.40%. На маленьком multilingual classroom тесте из 120 высказываний и 29 минут WavLM-TDNN получает 15.89% EER против 16.82% у адаптированного ECAPA-TDNN и 22.43% у base.
Ограничения. Данные закрытые и сильно доменно-специфичные: школьные классы, математика, ограниченный возрастной диапазон. Многоязычная проверка мала и скорее диагностическая, чем полноценная. Разметка speaker ID есть только у части записей, а аудио с пяти микрофонов усредняется в один сигнал, что может скрывать пространственную информацию, полезную для разделения говорящих.
Фишка из статьи. Главный численный результат не только в WavLM, а в двухступенчатом протоколе: self-supervised pretraining на доменном шуме без меток заметно выигрывает только после небольшой supervised адаптации.
| Метод | Fold 1 | Fold 2 | Fold 3 | Fold 4 | Fold 5 | Avg EER |
|---|---|---|---|---|---|---|
| SSL-only WavLM-TDNN | 18.28 | 14.91 | 17.70 | 18.74 | 19.28 | 17.78 |
| Two-stage WavLM-TDNN | 14.14 | 11.84 | 16.01 | 16.62 | 18.41 | 15.40 |
| ECAPA-TDNN base | 19.48 | 17.51 | 18.80 | 21.75 | 23.75 | 20.26 |
| ECAPA-TDNN adapted | 15.08 | 12.94 | 16.81 | 17.86 | 19.49 | 16.44 |
Как это читать: разница между 16.44% и 15.40% EER невелика, но она стабильна по всем пяти fold. Для такого шумного и частично размеченного домена стабильность важнее одной красивой средней цифры.