Многоязычная речь Диаризация Синтетическая разметка
arXiv cs.CL

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

arXiv:2608.14150

Системный отчёт MLC-SLM полезен двумя простыми приёмами для длинных разговоров. В распознавании с указанием говорящих авторы случайно меняют начало временной шкалы, а в вопросах по звуку отбрасывают синтетические задания, которые модель решает даже после замены разговора тишиной.

Метод. В первой задаче VibeVoice-ASR-7B за один проход выдаёт текст, говорящих и метки времени для записи до часа. При дообучении LoRA из начальной паузы вырезается случайный отрезок, после чего все временные метки сдвигаются на ту же величину; поверх этого ведётся экспоненциальное среднее обучаемых весов с коэффициентом 0,99. Во второй задаче Gemini 2.5 Pro создаёт около 210 тысяч вопросов по разговорному звуку. Qwen2.5-Omni проверяет каждый вопрос на тишине, после чего остаётся 67 тысяч аудиозависимых примеров; ещё 60 тысяч подгоняют длину вариантов ответа и сочетание языков. На итоговых 127 тысячах примеров дообучается Qwen3-Omni-30B-A3B-Instruct.

Результаты. В первой задаче средняя перестановочно-инвариантная ошибка tcpMER снижается с 18,30% до 17,27% после обрезки начальной тишины и до 16,73% после добавления усреднения весов. Это 1,57 абсолютного пункта, или 8,6% относительно исходной системы, без изменения однопроходного декодирования. Во второй задаче точность последовательно растёт с 78% до 81% после синтетических вопросов, до 83% после проверки тишиной, до 85% после согласования распределения и до 86% после строгих тегов ответа.

Ограничения. Разбор накопительный: нет отдельной строки только для EMA, поэтому его собственный вклад и взаимодействие с обрезкой неизвестны. Не показаны ошибки по языкам, длительности или моменту первой речи. Проверка тишиной лишь повышает вероятность звуковой опоры и может выбрасывать полезные лёгкие вопросы; она не доказывает, что ответ опирается на нужный участок записи. Оценка сделана на одном соревновании, а построение данных зависит от коммерческого Gemini и крупных моделей Qwen.

Фишка из статьи. Контрфактическая проверка выявляет, насколько много автоматически созданных «вопросов по звуку» на самом деле решаются по тексту вопроса и вариантам. После замены разговора тишиной фильтр пропускает лишь примерно треть исходного пула.

Этап второй задачиОбъёмТочность
Сгенерированные кандидатыоколо 210 тыс.81%
После проверки тишинойоколо 67 тыс. (32%)83%
После согласования распределенияоколо 127 тыс.85%
Плюс теги ответатот же набор86%

Как это читать: удаление 68% кандидатов повышает точность, хотя данных становится меньше. Затем авторы замечают другой сдвиг: варианты в проверке имеют в среднем 77,9 символа против 38,0 в трудных обучающих примерах, и синтетическое выравнивание этой длины даёт ещё два пункта.

Оригинальная статья на arXiv