Распознавание и озвучка в одном сервисе
В Speech Expert сформирована общая платформа для двух основных задач: превратить запись в текст и озвучить подготовленный текст. Веб-кабинет объединил работу с речью, а программные интерфейсы позволили встроить эти возможности в собственные приложения.
Выбор распознавания под задачу
В файловом распознавании появился выбор моделей, в том числе SpeechExpert-STT для русской речи, Whisper и ElevenLabs Scribe. Один и тот же сценарий загрузки можно использовать для разных вариантов обработки. Для разговоров предусмотрено разделение участников: по независимым каналам записи либо с помощью определения спикеров в общей дорожке.
Длительную обработку можно запускать как фоновую задачу и получать её состояние отдельно от результата. Это даёт приложению возможность показывать прогресс и возвращаться к операции, пока пользователь продолжает работу. Для интеграций предусмотрены REST, gRPC и маршруты транскрипции и синтеза в формате OpenAI Audio.
Использование видно в кабинете
К распознаванию и синтезу добавлен учёт в кредитах. Кабинет показывает баланс и историю использования, а перед выполнением платного этапа сервис проверяет доступные средства. Такая основа позволила развивать новые речевые сценарии с общими правилами доступа и учёта.