Длинная озвучка в фоне и несколько голосов в одном сценарии
Для лекций, инструкций и больших сценариев реализован фоновый синтез речи. Режим принимает текст до 40 000 символов, разбивает его на фрагменты и собирает озвучку в один WAV. Пользователь видит ход работы и число готовых частей.
Прогресс сохраняется
Синтез выполняется как отдельная задача. Обновление страницы не требует начинать заново: интерфейс возвращается к её состоянию. При остановке можно скачать уже готовую часть, а затем продолжить операцию с сохранённого места.
Автоматическое разбиение учитывает абзацы и предложения. Между готовыми фрагментами можно задать паузу, а итоговый файл не нужно вручную собирать из множества коротких запросов. Такой порядок упрощает подготовку длинного текста к прослушиванию.
Диалог с разными голосами
К тому же процессу добавлена озвучка по ролям: каждой роли назначается голос, а реплики задаются в нужном порядке. Результат собирается в общую дорожку. Это позволяет подготовить учебный диалог, интервью по сценарию или материал с несколькими рассказчиками и управлять его созданием как одной задачей.