Расшифровка длинных аудиозаписей до 10 ГБ
Загрузите лекцию, интервью или запись мероприятия одним файлом. Получайте текст и таймкоды постепенно, без предварительной ручной нарезки.
Режим работает на шести языках. Во время распознавания оставьте вкладку открытой и сохраняйте подключение к интернету.
После входа откроем длинный режим на русском языке с моделью SpeechExpert-STT-RU-stream за 0,28 ₽/мин. Выберите запись; язык и модель можно изменить. После подтверждения регистрации — 1 000 стартовых кредитов без карты.
Лекция становится текстом
Сегодня разберём, как подготовить материал к исследованию.
Перейдём к первому примеру и обсудим исходные данные.
Теперь сформулируем выводы и вопросы для самостоятельной работы.
Короткий учебный пример с таймкодами
Три синтезированные фразы, 18 секунд аудио. Пример показывает, как выглядит результат потокового распознавания и что попадёт в экспорт.
Запись обработана моделью SpeechExpert-STT-RU-stream в потоковом режиме. Таймкоды и текст получены при распознавании. Предел длительности и размер 10 ГБ на этом коротком примере не проверялись.
Текст по мере обработки
пассажиры скорый поезд прибудет на четвертый путь через несколько минут
почему шелковый шарф лежит рядом с тяжелой жестяной коробкой
в лаборатории проверили прочность гибких труб и тщательно записали результаты измерений
Текст без ручной правки. Полные интервалы фраз сохранены в SRT, VTT и JSON.
От большого файла к расшифровке
- 01
Выберите запись
Нажмите кнопку на этой странице: после входа длинный режим и модель SpeechExpert-STT-RU-stream будут выбраны. Загрузите файл и проверьте язык перед запуском.
- 02
Оставьте вкладку открытой
Текст появляется постепенно. Для непрерывной работы нужны стабильное соединение и активный браузер.
- 03
Сохраните результат
После завершения проверьте расшифровку и экспортируйте текст с доступными временными метками.
Вкладка работает до завершения записи
Длинный файл обрабатывается в потоке. Фоновой обработки и возобновления после обрыва нет: при повторном запуске распознавание начинается заново.
На время работы отключите автоматический сон устройства и оставьте вкладку открытой. Не обновляйте страницу, пока идёт распознавание.
Если вам нужны разделение участников, автоматическая коррекция или отчёты во время обработки, используйте обычный файловый режим и проверьте ограничения выбранной модели.
Потоковое распознавание через API →- Языки
- Русский, английский, казахский, кыргызский, узбекский, таджикский
- Результат
- Текст и таймкоды по мере обработки
- Говорящие
- Без разделения участников
- Таймкоды
- Для казахского, кыргызского, узбекского и таджикского относятся к аудиофрагментам
- Во время потока
- Автоматическая коррекция и отчёты недоступны
- Обрыв соединения
- Новый запуск с начала; возобновления нет
Стоимость зависит от выбранной модели
Кнопки на этой странице открывают длинный режим с моделью SpeechExpert-STT-RU-stream для русского языка: 7 кредитов за минуту, или 0,28 ₽ при стоимости кредита 0,04 ₽.
При обычном включении длинного режима в студии выбирается GigaAM-v3-RNNT: 8,75 кредита, или 0,35 ₽ за минуту. Два часа записи с этой моделью стоят 42 ₽.
Кредиты списываются постепенно за уже распознанную длительность. Стоимость зависит от языка и выбранной модели, в том числе для русского. Тариф показывается перед запуском.
Повторный запуск после обрыва обрабатывает запись заново. Ранее распознанная и оплаченная длительность при этом не переносится в новую задачу.
840 кредитов за два часа русской записи, если выбрать SpeechExpert-STT-RU-stream как итоговую модель. Кнопки на этой странице сразу выбирают эту модель. Если открыть длинный режим самостоятельно, проверьте выбранную модель.
После подтверждения регистрации начисляется 1 000 кредитов. Весь бонус можно использовать для первой проверки сервиса.
Открыть речевую студиюКак выбрать режим для длинной записи
Нужно ли нарезать запись заранее?
Режим «Текст по мере обработки» принимает один файл до 10 ГБ. Ручная нарезка для него не требуется. У обычного файлового режима другой лимит — до 500 МБ.
Можно ли закрыть браузер и вернуться позже?
В этом режиме вкладка должна оставаться открытой. Фонового выполнения и продолжения после обрыва нет; повторная попытка начинается с начала записи.
Будет видно, кто из участников говорил?
Разделение по участникам в потоке недоступно. Если нужна расшифровка интервью с участниками, используйте обычное файловое распознавание с поддерживающей эту опцию моделью.
Как работать с шумной русской записью?
Для сложной русской речи есть отдельный режим SpeechExpert Heavy. Он принимает файлы до 500 МБ и возвращает готовый текст после обработки, без точных пословных таймкодов.
Загрузите свою длинную запись
Откроем длинный режим на русском языке с моделью SpeechExpert-STT-RU-stream за 0,28 ₽/мин. Загрузите файл и проверьте параметры перед запуском.