распознавание выбранного говорящего разделение речи голосовые подсказки
arXiv eess.SP

Единое распознавание речи выбранного говорящего по текстовой подсказке и образцу голоса

arXiv:2609.33853

Модель распознаёт выбранного говорящего в смеси, принимая текстовую фразу, образец голоса или оба указания сразу. Главный вопрос статьи не в ещё одном способе слияния, а в том, может ли одна система заменить два специализированных распознавателя и разумно переживать отсутствие одной подсказки.

Метод. Параллельный вариант кодирует текст и голос раздельно, вариант Concat объединяет их в общую последовательность. При обучении подсказки случайно удаляются, чтобы система не зависела от всегда доступного канала; для образца голоса также проверяется компактное низкочастотное представление.

Результаты. При двух подсказках Concat получает CER 8,80%, Parallel 9,49%. Только с текстом Parallel лучше, 13,04 против 17,32%; только с голосом обе единые модели заметно уступают специализированной, 24,00 и 29,06 против 15,50%. Компактное голосовое представление даёт CER 16,04 при добавке лишь 0,192 млн параметров.

Ограничения. Основные данные китайские, текстовая подсказка извлекается из известной расшифровки, а не вводится пользователем в свободной форме. Concat плохо работает с одной подсказкой; внешняя языковая модель и потоковый режим не исследованы.

Фишка из статьи. Длина текстовой подсказки помогает не только на совпадающем отрезке. При росте с двух до пяти токенов CER вне самой подсказки снижается с 17,09 до 14,67%, то есть короткий лексический якорь улучшает глобальное разделение говорящих.

Длина подсказки, токеныОбщий CER ↓CER вне подсказки ↓
214,59%17,09%
312,55%16,46%
410,61%15,72%
58,80%14,67%

Как это читать: часть улучшения ожидаемо приходится на известные слова, но снижение ошибки за их пределами показывает более общий эффект выбора говорящего. При этом одной голосовой подсказкой единая модель пока не заменяет специализированную.

Оригинальная статья на arXiv