Синтез речи Просодия и эмоции Самообучение
arXiv eess.AS

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

arXiv:2608.15910

Управляемому выразительному синтезу нужны метки эмоции или словесного выделения, но именно они дороги и субъективны. Авторы предлагают не обучать отдельный классификатор, а заставить саму порождающую модель восстанавливать скрытую метку по наблюдаемой речи, затем несколько раз переобучаться на полученных псевдометках. Интерес работы в том, что она проверяет не только точность меток, но и слышимое управление выразительностью.

Метод. Основа - Matcha-TTS с условным согласованием потоков. Замороженная модель получает запись, а представление метки эмоции или акцента на слове оптимизируется градиентом так, чтобы лучше реконструировать эту запись; затем непрерывный вектор переводится в ближайшую дискретную метку. После очередного цикла размечаются все неразмеченные записи, модель дообучается на объединении настоящих и псевдометок, и процесс повторяется. Чтобы не принять накопленную ошибку за прогресс, авторы выбирают итерацию по точности на проверочной части и с нуля обучают итоговую модель на зафиксированном наборе.

Результаты. На английском ESD с пятью эмоциями и Naver-Prosody с двоичным словесным выделением метод полезен в ограниченном малоресурсном диапазоне. При 1% размеченных данных ESD F1 псевдометок растёт примерно с 0,33 до 0,40; F1 распознавания заданной эмоции в синтезе повышается с 26,58 до 29,87. При 5% данных этот показатель растёт с 39,38 до 49,58, а общий TTSDS - с 89,18 до 89,85. Для Naver-Prosody общий TTSDS повышается с 91,37 до 93,15 при 0,5% меток и с 91,57 до 92,66 при 1%.

Ограничения. Проверена одна основная архитектура, два английских корпуса и всего два типа выразительности; Naver-Prosody содержит речь одной женщины, а выделение сведено к двоичной метке. Сравнения с внешними классификаторами при одинаковом бюджете разметки нет. Объективная оценка эмоции зависит от emotion2vec и местами расходится со слушателями. В испытании участвовали 30 человек, поэтому небольшие различия имеют широкие доверительные интервалы.

Фишка из статьи. Улучшение псевдометок не всегда превращается в слышимую победу. Для эмоций при 1% данных слушатели дают ровную ничью, тогда как при 5% уже уверенно предпочитают итеративное обучение; для словесного выделения эффект проявляется раньше.

ЗадачаСравнениеВероятность выбора итеративной моделиВывод
Выделение, 0,5%Один проход против итераций0,656 ± 0,117Итерации лучше
Выделение, 1%Один проход против итераций0,678 ± 0,078Итерации лучше
Эмоция, 1%Один проход против итераций0,500 ± 0,094Ничья
Эмоция, 5%Один проход против итераций0,633 ± 0,037Итерации лучше

Как это читать: самообучение помогает только при достаточном исходном сигнале. При 0,5% эмоций модель не может надёжно запустить самоподдерживающееся улучшение, а 50 эпох между обновлениями псевдометок приводят к деградации; устойчивее оказался режим примерно по 10 эпох.

Оригинальная статья на arXiv