Многовариантная синтетическая разметка для преобразования акцента
Работа разбирает практическую слабость преобразования акцента без параллельных записей: один синтетический целевой пример легко оказывается неудачным по акценту, содержанию или голосу. Авторы генерируют несколько вариантов для каждого исходного высказывания, оценивают их и обучают модель только на наиболее подходящей дискретной последовательности.
Метод. Для каждой пары «исходная речь — целевой акцент» создаются восемь кандидатов. Отбор учитывает вероятность нужного акцента, сохранение текста и сходство с исходным диктором; выбранные коды затем служат разметкой для авторегрессионной модели преобразования. Проверяются шесть акцентов и 6600 условий, а восприятие дополнительно оценивают десять слушателей.
Результаты. Итоговая система получает точность определения целевого акцента 30,31%, WER 7,81% и сходство диктора 0,7135; субъективные оценки естественности, сходства и акцента равны 3,690, 3,560 и 3,131. При одинаковых 6600 условиях переход от одного кандидата к восьми повышает точность акцента с 28,08% до 30,57% и прирост вероятности целевого акцента с 9,77 до 11,70 п.п., почти не меняя сходство диктора.
Ограничения. Качество разметки зависит от синтезатора и автоматического классификатора акцента, а шесть выбранных акцентов не представляют всё разнообразие речи. Субъективная проверка мала: 10 слушателей и 12 исходных фраз. Сравнение с внешними системами также не полностью контролирует данные и условия обучения.
Фишка из статьи. Польза многовариантной генерации видна не только в итоговой точности, но и в доступности пригодной разметки: первый кандидат проходит фильтр лишь примерно в каждой пятой попытке, тогда как восемь попыток дают подходящий вариант более чем для половины условий.
| Отбор синтетической цели | Пригодные условия | Точность акцента | WER | Сходство диктора |
|---|---|---|---|---|
| Первый кандидат | 6600 из 29 754 (22,18%) | 28,08% | 7,82% | 0,7139 |
| Лучший из восьми | 16 153 из 29 754 (54,29%) | 30,57% | 8,11% | 0,7134 |
Как это читать: дополнительные попытки прежде всего расширяют покрытие качественной синтетической разметкой и усиливают акцент; цена в контролируемом опыте — небольшое ухудшение WER на 0,29 п.п., а не потеря голоса.