улучшение речи согласование потоков галлюцинации
arXiv cs.SD

AuraSE: генеративное улучшение речи с редкими галлюцинациями через согласование потоков и оптимизацию политики вывода

arXiv:2610.06632

AuraSE пытается сохранить сильные стороны генеративного улучшения речи, не позволяя модели дорисовывать фонемы и менять личность говорящего. Основной ход состоит из двух частей: раздельное моделирование аудио и транскрипции в MMDiT и обучение политики вывода, которая выбирает устойчивую траекторию генерации.

Метод. Двухпоточный трансформер обрабатывает шумный звук и текстовую подсказку от внешнего распознавателя, а мультимодальное согласование потоков восстанавливает чистую речь. Затем Inference Policy Optimization обучается в онлайновом режиме на собственных выборках модели, сравнивая конфигурации температуры, направляющего коэффициента и числа шагов. После обучения поиск не нужен: используется фиксированный вывод за 10 шагов ОДУ.

Результаты. На синтетическом тесте с реверберацией AuraSE-IPO получает DNSMOS OVRL 3,367, WER 8,22% и сходство говорящего 0,757 против 3,197, 9,65% и 0,730 у базовой AuraSE. Без реверберации WER снижается с 8,43% до 6,98%. На реальных записях DNS средняя оценка 15 слушателей достигает 3,74±0,13 против 3,60±0,13 у AuraSE и 3,43±0,16 у AnyEnhance.

Ограничения. Текст зависит от внешнего Whisper, а синтетическая часть оценки не полностью отражает реальные ошибки транскрипции. Слушательский тест включает 40 исходных примеров и 200 улучшенных клипов. Генерация остаётся многократным интегрированием потока, поэтому работа не доказывает пригодность для строгого потокового режима с малой задержкой.

Фишка из статьи. Самый показательный результат связан не с итоговым DNSMOS, а с выбором алгоритма предпочтений: обычный DPO на идеальных парах разрушает и разборчивость, и голосовую идентичность, тогда как онлайновый IPO удерживает оба свойства.

Дообучение политикиOVRLWER, %Сходство
Без оптимизации3,2048,810,758
DPO на эталонных парах3,11313,350,636
Офлайновый IPO3,2807,97—
Онлайновый IPO3,3737,590,775

Как это читать: предпочтения полезны только тогда, когда пары соответствуют распределению текущей политики. Попытка учить на «идеальном» выборе оказывается хуже исходной модели, а онлайновый IPO приближается к оракулу без перебора восьми конфигураций при каждом запуске.

Оригинальная статья на arXiv