Насколько устойчивы нейросетевые звуковые кодеки на африканской речи?
Статья показывает, что высокая перцептивная оценка нейросетевого кодека не гарантирует сохранения слов или личности диктора на африканских языках. Семь кодеков проверяются не только по качеству восстановления, но и по распознаванию речи, верификации говорящего и переносу после адаптации.
Метод. Используются три набора африканской речи и несколько моделей распознавания и верификации. Кодеки различаются частотой кадров, числом книг кодов и битрейтом; NISQA, UTMOS, ViSQOL, STOI и ошибка F0 сопоставляются с WER и EER. Для DAC отдельно проверяется адаптация распознавателя через LoRA и полную настройку.
Результаты. DAC 16 кбит/с даёт WER 28,26% и EER 0%, тогда как SemantiCodec 0,31 кбит/с — WER 76,22%, а FocalCodec 12,5 Гц — WER 57,02% и EER 10,63%. WavTokenizer S600 занимает первое место по NISQA на диалогах, но лишь 27-е из 28 по WER: 68,46%, EER 16,05%. Для DAC 8 кбит/с Encoder-LoRA снижает Whisper WER с 21,21% до 17,81%.
Ограничения. Нет симметричной неафриканской контрольной выборки, поэтому нельзя отделить языковой сдвиг от общей трудности корпусов. Самый глубокий анализ распознавания сосредоточен на одном диалоговом наборе, а некоторые ячейки и оценки F0 малы. Адаптация подробно проверена только для DAC.
Фишка из статьи. Перцептивная метрика может буквально перевернуть рейтинг для прикладной задачи. WavTokenizer нравится NISQA, но уничтожает столько языковой и дикторской информации, что оказывается почти последним по WER; при этом настройка менее 1% параметров распознавателя возвращает DAC почти к несжатому уровню.
| Сигнал для оценки кодека | Корреляция с WER на диалогах | Корреляция с EER на AfriNames | Практический смысл |
|---|---|---|---|
| NISQA | −0,43 | — | умеренно и местами неверно ранжирует содержание |
| UTMOS | −0,26 | 0,32 | почти не предсказывает пригодность |
| ViSQOL | −0,74 | −0,93 | лучше связан с обоими заданиями |
| STOI | −0,72 | −0,89 | разборчивость полезнее общего MOS |
| Ошибка F0 | 0,85 | 0,95 | сильно связана с потерей слов и диктора |
Как это читать: знак зависит от направления метрики, поэтому важны величина и согласованность. MOS-подобные оценки маскируют разрушение фонетики и голоса; для выбора кодека нужны прикладные WER/EER либо хотя бы метрики разборчивости и сохранения F0.