преобразование акцента синтетические данные сохранение диктора
arXiv eess.AS

Многовариантная синтетическая разметка для преобразования акцента

arXiv:2610.01961

Работа разбирает практическую слабость преобразования акцента без параллельных записей: один синтетический целевой пример легко оказывается неудачным по акценту, содержанию или голосу. Авторы генерируют несколько вариантов для каждого исходного высказывания, оценивают их и обучают модель только на наиболее подходящей дискретной последовательности.

Метод. Для каждой пары «исходная речь — целевой акцент» создаются восемь кандидатов. Отбор учитывает вероятность нужного акцента, сохранение текста и сходство с исходным диктором; выбранные коды затем служат разметкой для авторегрессионной модели преобразования. Проверяются шесть акцентов и 6600 условий, а восприятие дополнительно оценивают десять слушателей.

Результаты. Итоговая система получает точность определения целевого акцента 30,31%, WER 7,81% и сходство диктора 0,7135; субъективные оценки естественности, сходства и акцента равны 3,690, 3,560 и 3,131. При одинаковых 6600 условиях переход от одного кандидата к восьми повышает точность акцента с 28,08% до 30,57% и прирост вероятности целевого акцента с 9,77 до 11,70 п.п., почти не меняя сходство диктора.

Ограничения. Качество разметки зависит от синтезатора и автоматического классификатора акцента, а шесть выбранных акцентов не представляют всё разнообразие речи. Субъективная проверка мала: 10 слушателей и 12 исходных фраз. Сравнение с внешними системами также не полностью контролирует данные и условия обучения.

Фишка из статьи. Польза многовариантной генерации видна не только в итоговой точности, но и в доступности пригодной разметки: первый кандидат проходит фильтр лишь примерно в каждой пятой попытке, тогда как восемь попыток дают подходящий вариант более чем для половины условий.

Отбор синтетической целиПригодные условияТочность акцентаWERСходство диктора
Первый кандидат6600 из 29 754 (22,18%)28,08%7,82%0,7139
Лучший из восьми16 153 из 29 754 (54,29%)30,57%8,11%0,7134

Как это читать: дополнительные попытки прежде всего расширяют покрытие качественной синтетической разметкой и усиливают акцент; цена в контролируемом опыте — небольшое ухудшение WER на 0,29 п.п., а не потеря голоса.

Оригинальная статья на arXiv