Iterative Self-Learning for Expressive Text-to-Speech Synthesis
Управляемому выразительному синтезу нужны метки эмоции или словесного выделения, но именно они дороги и субъективны. Авторы предлагают не обучать отдельный классификатор, а заставить саму порождающую модель восстанавливать скрытую метку по наблюдаемой речи, затем несколько раз переобучаться на полученных псевдометках. Интерес работы в том, что она проверяет не только точность меток, но и слышимое управление выразительностью.
Метод. Основа - Matcha-TTS с условным согласованием потоков. Замороженная модель получает запись, а представление метки эмоции или акцента на слове оптимизируется градиентом так, чтобы лучше реконструировать эту запись; затем непрерывный вектор переводится в ближайшую дискретную метку. После очередного цикла размечаются все неразмеченные записи, модель дообучается на объединении настоящих и псевдометок, и процесс повторяется. Чтобы не принять накопленную ошибку за прогресс, авторы выбирают итерацию по точности на проверочной части и с нуля обучают итоговую модель на зафиксированном наборе.
Результаты. На английском ESD с пятью эмоциями и Naver-Prosody с двоичным словесным выделением метод полезен в ограниченном малоресурсном диапазоне. При 1% размеченных данных ESD F1 псевдометок растёт примерно с 0,33 до 0,40; F1 распознавания заданной эмоции в синтезе повышается с 26,58 до 29,87. При 5% данных этот показатель растёт с 39,38 до 49,58, а общий TTSDS - с 89,18 до 89,85. Для Naver-Prosody общий TTSDS повышается с 91,37 до 93,15 при 0,5% меток и с 91,57 до 92,66 при 1%.
Ограничения. Проверена одна основная архитектура, два английских корпуса и всего два типа выразительности; Naver-Prosody содержит речь одной женщины, а выделение сведено к двоичной метке. Сравнения с внешними классификаторами при одинаковом бюджете разметки нет. Объективная оценка эмоции зависит от emotion2vec и местами расходится со слушателями. В испытании участвовали 30 человек, поэтому небольшие различия имеют широкие доверительные интервалы.
Фишка из статьи. Улучшение псевдометок не всегда превращается в слышимую победу. Для эмоций при 1% данных слушатели дают ровную ничью, тогда как при 5% уже уверенно предпочитают итеративное обучение; для словесного выделения эффект проявляется раньше.
| Задача | Сравнение | Вероятность выбора итеративной модели | Вывод |
|---|---|---|---|
| Выделение, 0,5% | Один проход против итераций | 0,656 ± 0,117 | Итерации лучше |
| Выделение, 1% | Один проход против итераций | 0,678 ± 0,078 | Итерации лучше |
| Эмоция, 1% | Один проход против итераций | 0,500 ± 0,094 | Ничья |
| Эмоция, 5% | Один проход против итераций | 0,633 ± 0,037 | Итерации лучше |
Как это читать: самообучение помогает только при достаточном исходном сигнале. При 0,5% эмоций модель не может надёжно запустить самоподдерживающееся улучшение, а 50 эпох между обновлениями псевдометок приводят к деградации; устойчивее оказался режим примерно по 10 эпох.