AuraSE: генеративное улучшение речи с редкими галлюцинациями через согласование потоков и оптимизацию политики вывода
AuraSE пытается сохранить сильные стороны генеративного улучшения речи, не позволяя модели дорисовывать фонемы и менять личность говорящего. Основной ход состоит из двух частей: раздельное моделирование аудио и транскрипции в MMDiT и обучение политики вывода, которая выбирает устойчивую траекторию генерации.
Метод. Двухпоточный трансформер обрабатывает шумный звук и текстовую подсказку от внешнего распознавателя, а мультимодальное согласование потоков восстанавливает чистую речь. Затем Inference Policy Optimization обучается в онлайновом режиме на собственных выборках модели, сравнивая конфигурации температуры, направляющего коэффициента и числа шагов. После обучения поиск не нужен: используется фиксированный вывод за 10 шагов ОДУ.
Результаты. На синтетическом тесте с реверберацией AuraSE-IPO получает DNSMOS OVRL 3,367, WER 8,22% и сходство говорящего 0,757 против 3,197, 9,65% и 0,730 у базовой AuraSE. Без реверберации WER снижается с 8,43% до 6,98%. На реальных записях DNS средняя оценка 15 слушателей достигает 3,74±0,13 против 3,60±0,13 у AuraSE и 3,43±0,16 у AnyEnhance.
Ограничения. Текст зависит от внешнего Whisper, а синтетическая часть оценки не полностью отражает реальные ошибки транскрипции. Слушательский тест включает 40 исходных примеров и 200 улучшенных клипов. Генерация остаётся многократным интегрированием потока, поэтому работа не доказывает пригодность для строгого потокового режима с малой задержкой.
Фишка из статьи. Самый показательный результат связан не с итоговым DNSMOS, а с выбором алгоритма предпочтений: обычный DPO на идеальных парах разрушает и разборчивость, и голосовую идентичность, тогда как онлайновый IPO удерживает оба свойства.
| Дообучение политики | OVRL | WER, % | Сходство |
|---|---|---|---|
| Без оптимизации | 3,204 | 8,81 | 0,758 |
| DPO на эталонных парах | 3,113 | 13,35 | 0,636 |
| Офлайновый IPO | 3,280 | 7,97 | — |
| Онлайновый IPO | 3,373 | 7,59 | 0,775 |
Как это читать: предпочтения полезны только тогда, когда пары соответствуют распределению текущей политики. Попытка учить на «идеальном» выборе оказывается хуже исходной модели, а онлайновый IPO приближается к оракулу без перебора восьми конфигураций при каждом запуске.