звуковые кодеки африканская речь устойчивость
arXiv cs.SD

Насколько устойчивы нейросетевые звуковые кодеки на африканской речи?

arXiv:2610.00154

Статья показывает, что высокая перцептивная оценка нейросетевого кодека не гарантирует сохранения слов или личности диктора на африканских языках. Семь кодеков проверяются не только по качеству восстановления, но и по распознаванию речи, верификации говорящего и переносу после адаптации.

Метод. Используются три набора африканской речи и несколько моделей распознавания и верификации. Кодеки различаются частотой кадров, числом книг кодов и битрейтом; NISQA, UTMOS, ViSQOL, STOI и ошибка F0 сопоставляются с WER и EER. Для DAC отдельно проверяется адаптация распознавателя через LoRA и полную настройку.

Результаты. DAC 16 кбит/с даёт WER 28,26% и EER 0%, тогда как SemantiCodec 0,31 кбит/с — WER 76,22%, а FocalCodec 12,5 Гц — WER 57,02% и EER 10,63%. WavTokenizer S600 занимает первое место по NISQA на диалогах, но лишь 27-е из 28 по WER: 68,46%, EER 16,05%. Для DAC 8 кбит/с Encoder-LoRA снижает Whisper WER с 21,21% до 17,81%.

Ограничения. Нет симметричной неафриканской контрольной выборки, поэтому нельзя отделить языковой сдвиг от общей трудности корпусов. Самый глубокий анализ распознавания сосредоточен на одном диалоговом наборе, а некоторые ячейки и оценки F0 малы. Адаптация подробно проверена только для DAC.

Фишка из статьи. Перцептивная метрика может буквально перевернуть рейтинг для прикладной задачи. WavTokenizer нравится NISQA, но уничтожает столько языковой и дикторской информации, что оказывается почти последним по WER; при этом настройка менее 1% параметров распознавателя возвращает DAC почти к несжатому уровню.

Сигнал для оценки кодекаКорреляция с WER на диалогахКорреляция с EER на AfriNamesПрактический смысл
NISQA−0,43—умеренно и местами неверно ранжирует содержание
UTMOS−0,260,32почти не предсказывает пригодность
ViSQOL−0,74−0,93лучше связан с обоими заданиями
STOI−0,72−0,89разборчивость полезнее общего MOS
Ошибка F00,850,95сильно связана с потерей слов и диктора

Как это читать: знак зависит от направления метрики, поэтому важны величина и согласованность. MOS-подобные оценки маскируют разрушение фонетики и голоса; для выбора кодека нужны прикладные WER/EER либо хотя бы метрики разборчивости и сохранения F0.

Оригинальная статья на arXiv