Платформа API
Новости сервиса

Распознавание и озвучка в одном сервисе

Из истории Speech Expert

В Speech Expert сформирована общая платформа для двух основных задач: превратить запись в текст и озвучить подготовленный текст. Веб-кабинет объединил работу с речью, а программные интерфейсы позволили встроить эти возможности в собственные приложения.

Выбор распознавания под задачу

В файловом распознавании появился выбор моделей, в том числе SpeechExpert-STT для русской речи, Whisper и ElevenLabs Scribe. Один и тот же сценарий загрузки можно использовать для разных вариантов обработки. Для разговоров предусмотрено разделение участников: по независимым каналам записи либо с помощью определения спикеров в общей дорожке.

Длительную обработку можно запускать как фоновую задачу и получать её состояние отдельно от результата. Это даёт приложению возможность показывать прогресс и возвращаться к операции, пока пользователь продолжает работу. Для интеграций предусмотрены REST, gRPC и маршруты транскрипции и синтеза в формате OpenAI Audio.

Использование видно в кабинете

К распознаванию и синтезу добавлен учёт в кредитах. Кабинет показывает баланс и историю использования, а перед выполнением платного этапа сервис проверяет доступные средства. Такая основа позволила развивать новые речевые сценарии с общими правилами доступа и учёта.