Evaluating Pre-trained Speech Encoders for Spontaneous Speech Detection and Out of Domain Synthetic Speech Generalisation in Indic Languages
Статья связывает две обычно раздельные задачи: различение спонтанной и читаемой речи и выявление синтетической речи на 22 языках Индии. Самый полезный результат не в очередной итоговой точности, а в геометрии признаков: перенос на неизвестный синтезатор лучше предсказывает близость к знакомому синтезатору, а не удалённость от естественной речи.
Метод. Для определения стиля речи из замороженных AST, Vaani-FastConformer, wav2vec 2.0, Whisper и BEATs извлекаются векторы, поверх которых обучается небольшая полносвязная сеть. Основной материал даёт IndicVoices с разметкой Read, Extempore и Conversation, а IEMOCAP служит английской проверкой. Дополнительный логистический пробник измеряет, насколько легко по вектору восстановить язык. Для выявления синтеза используется Whisper-small: обучение ведётся на сочетаниях Indic F5, Indic VITS, OmniVoice и Meta M4, а freevc24 и XTTS-v2 полностью оставлены за пределами обучения.
Результаты. Whisper и Vaani дают наиболее ровную точность определения спонтанной речи на 22 языках и IEMOCAP. У wav2vec 2.0 языковая различимость отрицательно связана с точностью основной задачи: Pearson r = -0,62 при p = 0,0015; у Whisper и Vaani статистически значимой связи нет. Для неизвестного синтеза обучение только на F5 даёт полноту 7,59%, только на OmniVoice - 28,61%, а смесь четырёх систем - 51,13%. Естественная речь при этом распознаётся с полнотой около 99%.
Ограничения. У части задачи стиль речи определяется сценарием записи, а IEMOCAP состоит из актёрских диалогов, поэтому «спонтанность» не полностью совпадает с бытовой разговорной речью. Эксперимент с синтетической речью использует только Whisper-small и ограниченный набор синтезаторов и языков; кодеки, шум, повторная запись и голосовые преобразования не проверены. Даже лучший вариант на неизвестных системах находит лишь 51% синтетических примеров, так что это анализ причин отказа, а не готовый надёжный детектор.
Фишка из статьи. Близость к естественной речи оказалась плохим ориентиром для выбора обучающих подделок. F5 расположен ближе всего к естественному центроиду, но почти не помогает против двух неизвестных систем; OmniVoice дальше от естественной речи, зато геометрически ближе к freevc24 и XTTS-v2.
| Синтезаторы в обучении | Полнота на неизвестных системах | Полнота на естественной речи |
|---|---|---|
| Только F5 | 7,59% | 99,39% |
| Только OmniVoice | 28,61% | 99,39% |
| OmniVoice + Indic VITS | 49,11% | 99,39% |
| F5 + OmniVoice + Indic VITS + M4 | 51,13% | 99,11% |
Как это читать: разнообразие повышает полноту в 6,7 раза относительно одного F5, но потолок остаётся низким. Практический вывод - подбирать синтетические данные следует по покрытию разных кластеров генераторов, а не только по тому, насколько правдоподобно они звучат.