ProLombard: Structured Multi-Scale Modeling for Normal-to-Lombard Speech Conversion
ProLombard преобразует обычную речь в ломбардную манеру, которая возникает, когда человек говорит в шуме: растут основная частота, энергия высоких частот и артикуляционная выраженность. Модель отдельно выравнивает стиль на уровне фразы и фонем, чтобы усилить разборчивость, не потеряв личность говорящего.
Метод. Многомасштабное согласование связывает целую фразу с образцом ломбардной речи, а фонемный блок сначала удаляет исходные локальные признаки и затем вводит целевые. Квантование с медианным представителем стабилизирует стиль. Сравнение проводится на китайском EMALG и английском наборе.
Результаты. В субъективном тесте 20 слушателей и 144 примеров ProLombard получает 72,40 по сходству со стилем и 82,01 по качеству против 61,41 и 74,25 у PGD. На китайском WRR равен 41,31% против 37,34%, SIIB 33,08 против 31,30, SECS 0,64 против 0,60. Английский WRR растёт с 24,62% до 26,04%, а UTMOS с 3,90 до 4,07.
Ограничения. Наборы ломбардной речи невелики и покрывают только два языка. До естественной ломбардной речи остаётся заметный субъективный разрыв: 72,40 против 93,31 по стилю. Некоторые метрики личности и основной частоты улучшаются не одновременно, поэтому единый итоговый балл скрывает обмены.
Фишка из статьи. Фонемный блок работает только как пара операций: удалить обычный стиль и ввести ломбардный. Одна половина почти не даёт нужной частотной перестройки.
| Вариант на EMALG | WRR, % | Ошибка спектрального наклона α |
|---|---|---|
| Полная модель | 41,31 | 1,06 |
| Только покадровое моделирование | 39,09 | 1,91 |
| Только удаление признаков | 38,19 | 1,87 |
| Только введение признаков | 40,48 | 1,93 |
Как это читать: введение целевого стиля помогает словам, но без предварительного удаления исходной манеры спектральный наклон остаётся почти как в ослабленных вариантах. Двухходовая конструкция нужна для согласованного преобразования.