MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching
MiDashengLM-Gen генерирует одной моделью сцены, где речь, музыка и шумовые события звучат одновременно. Главный инженерный ход - языковая модель последовательно задает каждый непрерывный звуковой признак, а небольшой DiT восстанавливает его согласованием потоков; это резко повышает разборчивость речи по сравнению с прежней раздельной схемой.
Метод. Qwen3-1.7B совместно кодирует текст и историю звука, а для каждой позиции запускает условное согласование потоков в 768-мерном пространстве DashengTokenizer. Признаки с частотой 25 Гц сжимаются до 5 Гц; отдельная голова остановки задает переменную длину от 1 до 20 секунд. Перед генеративным обучением проводится выравнивание звука и текста по общим подписям. Основные данные - 77 тысяч часов ACAVCaps плюс специализированные китайские и английские корпуса синтеза.
Результаты. На Seed-TTS английский WER снижается с 12,15% у Dasheng AudioGen до 2,79%, китайский CER - с более 100% до 3,87%; специализированная Qwen3-TTS все еще лучше с 1,24% и 0,77%. В девяти языках средняя ошибка MiDasheng равна 7,68%, но русский WER достигает 13,19%, японский CER - 16,45%. В смешанных сценах со звуком речи FAD лучше базового: 0,98 против 1,70 для речи с музыкой, 1,88 против 2,17 для речи, музыки и эффектов.
Ограничения. Длина ограничена обучающим диапазоном 1-20 секунд, а долгие сцены не проверены. Разборчивость все еще примерно в 2,2 раза хуже специализированного синтеза на английском и заметно проседает для языков с малой долей данных. Есть лишь грубое управление стилем говорящего, без клонирования конкретного голоса и точного временного монтажа. На чистом AudioCaps FAD 5,01 существенно хуже 2,26 у специализированного TangoFlux.
Фишка из статьи. Самая сильная абляция касается не размера модели, а предварительного выравнивания модальностей: без него генератор учится звучать, но теряет связь между текстом и фонетикой.
| Проверка | Без выравнивания | Полная модель |
|---|---|---|
| AudioCaps FAD | 9,39 | 5,01 |
| Seed-TTS EN WER | 12,17% | 2,79% |
| Seed-TTS ZH CER | 14,17% | 3,87% |
| Средняя ошибка по 9 языкам | 31,73% | 7,68% |
Как это читать: выравнивание уменьшает английский WER в 4,4 раза, а среднюю многоязычную ошибку - в 4,1 раза. Дополнительный опыт с шириной DiT показывает похожее жесткое условие: при латентной размерности 768 ширина 752 и 768 не сходится, а 784 уже сходится.