Потоковое распознавание на казахском и узбекском
В Speech Expert добавлена поддержка казахского и узбекского языков в потоковом распознавании. Аудио можно передавать по мере записи, получая промежуточный текст и окончательные результаты завершённых фраз через WebSocket или gRPC.
Текст во время разговора
Потоковый режим подходит для живых субтитров и приложений, которым нужен текст до окончания всей записи. Текущая гипотеза уточняется по мере поступления речи; после завершения фразы приложение получает окончательный результат и может сохранить его в транскрипте.
Язык выбирается в начале сессии и действует до её завершения. Для переключения языка нужно открыть новую сессию. Казахские и узбекские результаты содержат границы аудиофрагментов; пословные таймкоды для этих потоковых режимов не предоставляются.
Один порядок работы для интеграций
Обновлена документация по подключению, форматам аудио и завершению потока. Клиенту нужно одновременно отправлять звук и принимать ответы, а после последнего фрагмента дождаться завершения распознавания: окончательный текст может прийти уже после остановки записи.