Распознавание Языки Модели
Новости сервиса

Gemini Transcribe добавлен к моделям распознавания

Из истории Speech Expert

В выбор моделей добавлен Gemini 3.5 Transcribe для файлового распознавания. В публичном профиле сервиса он доступен для русского, английского, казахского, кыргызского, узбекского и таджикского языков.

Таймкоды и участники

Интеграция получает от модели временные отметки слов и поддерживает автоматическое разделение спикеров. Эти данные используются в представлении расшифровки: можно читать реплики участников и находить соответствующие места в аудио.

Вариант с временными отметками рассчитан на записи до 30 минут. Модель определяет до восьми спикеров автоматически; работа с тремя и более участниками обозначена как экспериментальная. Этот маршрут предназначен для готовых файлов, а не для живых субтитров с микрофона.

Понятный выбор обработки

Gemini отображается в списке совместимых моделей после выбора языка. В интерфейсе указано, что при таком распознавании аудио передаётся Google API. Одновременно улучшена обработка WAV с вещественными аудиосэмплами, чтобы файлы из аудиоредакторов корректно подготавливались к распознаванию.