Оценка качества Voice control Speaker similarity
Оценка управляемости речи

Voice control audit: нужный атрибут меняется вместе с лишними

5,940 outputs

Эта статья полезна для оценки синтеза речи: prompt adherence сам по себе не говорит, сохранились ли остальные свойства голоса. Если попросить "deep voice", модель может снизить F0, но одновременно замедлить речь, изменить энергию, спектральный центр, roll-off и похожесть говорящего. Авторы строят paired audit на 5,940 outputs от CosyVoice3, VoxCPM2 и Fish-Speech-S2 и отделяют целевой сдвиг от побочных изменений.

Метод. Для каждой системы используются 6 reference speakers, 10 English texts, 3 random seeds и 11 conditions. Сравнение парное: descriptor-conditioned output сопоставляется с matched neutral baseline того же speaker/text/seed. Для deep целевыми признаками считаются F0 down и rolloff down; для bright - centroid up и rolloff up; для rough - flatness и zero-crossing rate как слабые proxies. Content preservation проверяется через ASR transcript, speaker preservation - через ECAPA-TDNN cosine similarity. VoDER-Cal выбирает из трех кандидатов тот, который сохраняет target response, но минимизирует off-target deviation.

Результаты. Системы часто двигаются в нужном направлении: для deep target direction равен 84.4% у CosyVoice3, 77.2% у VoxCPM2, 71.1% у Fish-Speech-S2. Но среди target-responsive outputs побочные изменения встречаются часто: CosyVoice3 deep 93.8%, bright 89.9%, rough 87.7%; VoxCPM2 deep 95.8%, bright 87.3%, rough 94.1%; Fish-Speech-S2 bright 54.5%, rough 81.1%. VoDER-Cal при B=3 сохраняет target retain 99.1%, дает all checks 14.3% против 14.1% у target-only, но снижает held-out off-target deviation с 0.344 до 0.276. В perceptual H2 combined люди предпочитают VoDER-Cal по off-target preservation в 63.3% суждений против 9.9% за target-only.

Ограничения. Оценка покрывает только три системы, английские тексты и измеримые атрибуты deep, bright, rough. Некоторые proxies, особенно roughness через flatness и zero-crossing rate, слабые и не заменяют человеческую перцепцию. VoDER-Cal требует нескольких генераций на один запрос и не улучшает саму модель. Joint success остается низким: около 14%, то есть candidate selection смягчает проблему, но не решает точный voice control.

Фишка из статьи. Сильный результат - conditional audit: даже если модель явно ответила на целевой атрибут, побочные изменения не исчезают. Поэтому отчетность только по target direction систематически завышает качество управления.

Model + descriptorTarget directionResponsive с off-targetContentSpeaker sim
CosyVoice3 deep84.4%93.8%100.0%0.886
CosyVoice3 bright71.1%89.9%100.0%0.902
VoxCPM2 deep77.2%95.8%99.4%0.821
VoxCPM2 rough53.9%94.1%100.0%0.845
Fish-Speech-S2 bright48.9%54.5%100.0%0.897

Как это читать: высокая content preservation не означает локальный контроль голоса. Модель может правильно произнести текст и сохранить speaker similarity, но все равно изменить несколько нецелевых акустических параметров вместе с requested attribute.

Оригинальная статья на arXiv