преобразование голоса ломбардная речь разборчивость
arXiv cs.SD

ProLombard: Structured Multi-Scale Modeling for Normal-to-Lombard Speech Conversion

arXiv:2609.04828

ProLombard преобразует обычную речь в ломбардную манеру, которая возникает, когда человек говорит в шуме: растут основная частота, энергия высоких частот и артикуляционная выраженность. Модель отдельно выравнивает стиль на уровне фразы и фонем, чтобы усилить разборчивость, не потеряв личность говорящего.

Метод. Многомасштабное согласование связывает целую фразу с образцом ломбардной речи, а фонемный блок сначала удаляет исходные локальные признаки и затем вводит целевые. Квантование с медианным представителем стабилизирует стиль. Сравнение проводится на китайском EMALG и английском наборе.

Результаты. В субъективном тесте 20 слушателей и 144 примеров ProLombard получает 72,40 по сходству со стилем и 82,01 по качеству против 61,41 и 74,25 у PGD. На китайском WRR равен 41,31% против 37,34%, SIIB 33,08 против 31,30, SECS 0,64 против 0,60. Английский WRR растёт с 24,62% до 26,04%, а UTMOS с 3,90 до 4,07.

Ограничения. Наборы ломбардной речи невелики и покрывают только два языка. До естественной ломбардной речи остаётся заметный субъективный разрыв: 72,40 против 93,31 по стилю. Некоторые метрики личности и основной частоты улучшаются не одновременно, поэтому единый итоговый балл скрывает обмены.

Фишка из статьи. Фонемный блок работает только как пара операций: удалить обычный стиль и ввести ломбардный. Одна половина почти не даёт нужной частотной перестройки.

Вариант на EMALGWRR, %Ошибка спектрального наклона α
Полная модель41,311,06
Только покадровое моделирование39,091,91
Только удаление признаков38,191,87
Только введение признаков40,481,93

Как это читать: введение целевого стиля помогает словам, но без предварительного удаления исходной манеры спектральный наклон остаётся почти как в ослабленных вариантах. Двухходовая конструкция нужна для согласованного преобразования.

Оригинальная статья на arXiv