Единое распознавание речи выбранного говорящего по текстовой подсказке и образцу голоса
Модель распознаёт выбранного говорящего в смеси, принимая текстовую фразу, образец голоса или оба указания сразу. Главный вопрос статьи не в ещё одном способе слияния, а в том, может ли одна система заменить два специализированных распознавателя и разумно переживать отсутствие одной подсказки.
Метод. Параллельный вариант кодирует текст и голос раздельно, вариант Concat объединяет их в общую последовательность. При обучении подсказки случайно удаляются, чтобы система не зависела от всегда доступного канала; для образца голоса также проверяется компактное низкочастотное представление.
Результаты. При двух подсказках Concat получает CER 8,80%, Parallel 9,49%. Только с текстом Parallel лучше, 13,04 против 17,32%; только с голосом обе единые модели заметно уступают специализированной, 24,00 и 29,06 против 15,50%. Компактное голосовое представление даёт CER 16,04 при добавке лишь 0,192 млн параметров.
Ограничения. Основные данные китайские, текстовая подсказка извлекается из известной расшифровки, а не вводится пользователем в свободной форме. Concat плохо работает с одной подсказкой; внешняя языковая модель и потоковый режим не исследованы.
Фишка из статьи. Длина текстовой подсказки помогает не только на совпадающем отрезке. При росте с двух до пяти токенов CER вне самой подсказки снижается с 17,09 до 14,67%, то есть короткий лексический якорь улучшает глобальное разделение говорящих.
| Длина подсказки, токены | Общий CER ↓ | CER вне подсказки ↓ |
|---|---|---|
| 2 | 14,59% | 17,09% |
| 3 | 12,55% | 16,46% |
| 4 | 10,61% | 15,72% |
| 5 | 8,80% | 14,67% |
Как это читать: часть улучшения ожидаемо приходится на известные слова, но снижение ошибки за их пределами показывает более общий эффект выбора говорящего. При этом одной голосовой подсказкой единая модель пока не заменяет специализированную.