Как паузы и наложения в синтетических диалогах влияют на распознавание
Статья рассматривает синтетические многоговорящие диалоги не как статичную имитацию корпуса, а как управляемый источник обучающих условий для распознавания речи. Авторы меняют распределения пауз, задержек и наложений речи и смотрят, какие свойства синтетического времени действительно улучшают модель на реальных диалогах. Главный вывод неожиданный: в изученном диапазоне больше exposure к наложениям помогает, а длинные и вариативные паузы связаны с худшим cpWER.
Метод. Временная структура диалога параметризуется через exponential tilting family, оцененную по GRASS, CallHome и BEA-Dialogue. Затем четырехмерное пространство timing-параметров исследуется Latin hypercube sampling и многоцелевой байесовской оптимизацией: для каждой конфигурации генерируются синтетические разговоры, обучается распознаватель и считается cpWER/cpCER. Отдельно авторы сравнивают «сырые» параметры распределения и более интерпретируемые признаки: overlap rate, overlap tail mass, mean gap, delay mean и другие.
Результаты. На evaluation set все шесть основных timing-признаков значимо связаны с cpWER после поправки Benjamini-Hochberg. Overlap rate имеет Spearman rho -0.645 с cpWER, overlap tail mass -0.622; mean gap, gap tail mass и delay mean, наоборот, положительно связаны с ошибкой: 0.647, 0.656 и 0.642. Регрессионный анализ подтверждает, что сами timing features объясняют cpWER лучше, чем исходные theta-параметры: cross-validated R2 0.529 против 0.280, а совместная модель поднимает R2 до 0.588.
Ограничения. Эксперименты построены на 25 конфигурациях и одной основной оценочной задаче, поэтому корреляции не стоит читать как универсальные причинные законы для всех диалоговых корпусов. Результат зависит от генератора синтетических разговоров и от модели распознавания. cpCER показывает те же направления, но слабее и без такой же статистической устойчивости, что ограничивает обобщение на языки и письменности с иной структурой ошибок.
Фишка из статьи. Практически полезна таблица корреляций: она говорит, какие именно timing-переменные стоит контролировать при генерации обучающих диалогов, а не просто «делать похоже на корпус».
| Признак времени | rho с cpWER | q для cpWER | rho с cpCER |
|---|---|---|---|
| Overlap rate | -0.645 | 0.002 | -0.409 |
| Overlap tail mass | -0.622 | 0.003 | -0.399 |
| Mean gap | 0.647 | 0.002 | 0.390 |
| Gap tail mass | 0.656 | 0.002 | 0.409 |
| Delay mean | 0.642 | 0.002 | 0.395 |
| Delay std | 0.564 | 0.008 | 0.365 |
Как это читать: для обучения разговорного распознавания важны не только слова и шум, но и микродинамика очередности. В этих экспериментах частые наложения дают полезную нагрузку, а большие паузы делают синтетику менее полезной.