Voice control audit: нужный атрибут меняется вместе с лишними
Эта статья полезна для оценки синтеза речи: prompt adherence сам по себе не говорит, сохранились ли остальные свойства голоса. Если попросить "deep voice", модель может снизить F0, но одновременно замедлить речь, изменить энергию, спектральный центр, roll-off и похожесть говорящего. Авторы строят paired audit на 5,940 outputs от CosyVoice3, VoxCPM2 и Fish-Speech-S2 и отделяют целевой сдвиг от побочных изменений.
Метод. Для каждой системы используются 6 reference speakers, 10 English texts, 3 random seeds и 11 conditions. Сравнение парное: descriptor-conditioned output сопоставляется с matched neutral baseline того же speaker/text/seed. Для deep целевыми признаками считаются F0 down и rolloff down; для bright - centroid up и rolloff up; для rough - flatness и zero-crossing rate как слабые proxies. Content preservation проверяется через ASR transcript, speaker preservation - через ECAPA-TDNN cosine similarity. VoDER-Cal выбирает из трех кандидатов тот, который сохраняет target response, но минимизирует off-target deviation.
Результаты. Системы часто двигаются в нужном направлении: для deep target direction равен 84.4% у CosyVoice3, 77.2% у VoxCPM2, 71.1% у Fish-Speech-S2. Но среди target-responsive outputs побочные изменения встречаются часто: CosyVoice3 deep 93.8%, bright 89.9%, rough 87.7%; VoxCPM2 deep 95.8%, bright 87.3%, rough 94.1%; Fish-Speech-S2 bright 54.5%, rough 81.1%. VoDER-Cal при B=3 сохраняет target retain 99.1%, дает all checks 14.3% против 14.1% у target-only, но снижает held-out off-target deviation с 0.344 до 0.276. В perceptual H2 combined люди предпочитают VoDER-Cal по off-target preservation в 63.3% суждений против 9.9% за target-only.
Ограничения. Оценка покрывает только три системы, английские тексты и измеримые атрибуты deep, bright, rough. Некоторые proxies, особенно roughness через flatness и zero-crossing rate, слабые и не заменяют человеческую перцепцию. VoDER-Cal требует нескольких генераций на один запрос и не улучшает саму модель. Joint success остается низким: около 14%, то есть candidate selection смягчает проблему, но не решает точный voice control.
Фишка из статьи. Сильный результат - conditional audit: даже если модель явно ответила на целевой атрибут, побочные изменения не исчезают. Поэтому отчетность только по target direction систематически завышает качество управления.
| Model + descriptor | Target direction | Responsive с off-target | Content | Speaker sim |
|---|---|---|---|---|
| CosyVoice3 deep | 84.4% | 93.8% | 100.0% | 0.886 |
| CosyVoice3 bright | 71.1% | 89.9% | 100.0% | 0.902 |
| VoxCPM2 deep | 77.2% | 95.8% | 99.4% | 0.821 |
| VoxCPM2 rough | 53.9% | 94.1% | 100.0% | 0.845 |
| Fish-Speech-S2 bright | 48.9% | 54.5% | 100.0% | 0.897 |
Как это читать: высокая content preservation не означает локальный контроль голоса. Модель может правильно произнести текст и сохранить speaker similarity, но все равно изменить несколько нецелевых акустических параметров вместе с requested attribute.