Генерация звука Синтез речи Согласование потоков
arXiv eess.AS

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

arXiv:2608.11804

MiDashengLM-Gen генерирует одной моделью сцены, где речь, музыка и шумовые события звучат одновременно. Главный инженерный ход - языковая модель последовательно задает каждый непрерывный звуковой признак, а небольшой DiT восстанавливает его согласованием потоков; это резко повышает разборчивость речи по сравнению с прежней раздельной схемой.

Метод. Qwen3-1.7B совместно кодирует текст и историю звука, а для каждой позиции запускает условное согласование потоков в 768-мерном пространстве DashengTokenizer. Признаки с частотой 25 Гц сжимаются до 5 Гц; отдельная голова остановки задает переменную длину от 1 до 20 секунд. Перед генеративным обучением проводится выравнивание звука и текста по общим подписям. Основные данные - 77 тысяч часов ACAVCaps плюс специализированные китайские и английские корпуса синтеза.

Результаты. На Seed-TTS английский WER снижается с 12,15% у Dasheng AudioGen до 2,79%, китайский CER - с более 100% до 3,87%; специализированная Qwen3-TTS все еще лучше с 1,24% и 0,77%. В девяти языках средняя ошибка MiDasheng равна 7,68%, но русский WER достигает 13,19%, японский CER - 16,45%. В смешанных сценах со звуком речи FAD лучше базового: 0,98 против 1,70 для речи с музыкой, 1,88 против 2,17 для речи, музыки и эффектов.

Ограничения. Длина ограничена обучающим диапазоном 1-20 секунд, а долгие сцены не проверены. Разборчивость все еще примерно в 2,2 раза хуже специализированного синтеза на английском и заметно проседает для языков с малой долей данных. Есть лишь грубое управление стилем говорящего, без клонирования конкретного голоса и точного временного монтажа. На чистом AudioCaps FAD 5,01 существенно хуже 2,26 у специализированного TangoFlux.

Фишка из статьи. Самая сильная абляция касается не размера модели, а предварительного выравнивания модальностей: без него генератор учится звучать, но теряет связь между текстом и фонетикой.

ПроверкаБез выравниванияПолная модель
AudioCaps FAD9,395,01
Seed-TTS EN WER12,17%2,79%
Seed-TTS ZH CER14,17%3,87%
Средняя ошибка по 9 языкам31,73%7,68%

Как это читать: выравнивание уменьшает английский WER в 4,4 раза, а среднюю многоязычную ошибку - в 4,1 раза. Дополнительный опыт с шириной DiT показывает похожее жесткое условие: при латентной размерности 768 ширина 752 и 768 не сходится, а 784 уже сходится.

Оригинальная статья на arXiv