Перейти к содержанию

Восстановление аудио

В Речевой студии откройте вкладку Восстановление аудио. Она создаёт новую озвучку русской записи с шумом или искажениями. Речь делится на фрагменты, и для каждого восстанавливаемого фрагмента используется его собственный голос.

  1. Загрузите исходный аудиофайл.
  2. Нажмите Восстановить аудио. Silero VAD находит речь и разделяет её по паузам. SpeechExpert Heavy восстанавливает текст каждого фрагмента, затем ElevenLabs v4 отдельно клонирует его голос и озвучивает полученный текст.
  3. Прослушайте оригинал и результат, скачайте новую запись. Кнопка Синтезировать заново повторяет озвучивание всех восстановленных фрагментов с уже распознанным текстом. Новый синтез оплачивается повторно.

Распознанный текст передаётся в синтез автоматически и не выводится отдельным редактором. Предупреждения об ограничениях восстановления отображаются под результатом. Heavy не гарантирует точность слов, которые нельзя разобрать в исходной записи.

Фрагменты и голоса

Вкладка использует ElevenLabs v4 через настроенное подключение ElevenLabs. Выбирать модель или загружать отдельный образец голоса не требуется. Silero VAD определяет реальные речевые участки в браузере на протяжении всей записи. Длинные участки делятся на фрагменты до 30 секунд по участкам низкой энергии. Каждый фрагмент передаётся в Heavy и затем в ElevenLabs отдельно. Голоса соседних фрагментов не объединяются в один образец для клонирования.

Разделение по паузам помогает приблизительно сохранить разных говорящих, когда их реплики попадают в отдельные фрагменты. VAD не определяет личность спикера и не связывает его повторные реплики. Смена голоса внутри непрерывной речи и речь нескольких людей одновременно могут привести к смешиванию голосов.

Фрагменты короче одной секунды сохраняются в исходном виде: для них не запускаются платное распознавание и клонирование. Под исходной записью после обработки показываются общее количество фрагментов, количество восстановленных и количество сохранённых исходных фрагментов. Наличие коротких фрагментов также отмечается предупреждением.

VAD работает локально, без отдельного модельного сервиса и без передачи исходной записи внешнему провайдеру для поиска речи. Если речевые участки не найдены, подготовка останавливается до платного распознавания. Загрузите другую запись с разборчивой речью.

ElevenLabs получает отдельный речевой фрагмент с включённым удалением фонового шума. Отдельная расшифровка для клонирования не требуется: текст Heavy используется непосредственно для новой озвучки этого фрагмента.

Длительность и результат

Принимаются файлы до 100 МБ и длительностью до одного часа. Если формат нельзя декодировать, сохраните исходную запись в WAV или MP3 и загрузите её заново. До запуска платных операций проверяется предел в 200 фрагментов. Для более длинной записи с большим количеством фрагментов разделите исходный файл на несколько частей.

API клонирования ElevenLabs принимает образцы от 1 до 120 секунд. Для каждого восстанавливаемого фрагмента подготавливается собственный допустимый образец. Распознанный текст каждого фрагмента ограничен 40 000 символами по умолчанию.

Новые речевые фрагменты собираются последовательно в WAV PCM16 mono, с сохранением длительности исходных пауз между ними и тишины в начале и конце записи. Синтез может изменить длительность отдельных реплик, поэтому общая длительность результата и положения последующих реплик могут отличаться от оригинала. Темп и интонации также могут измениться. Размер итогового WAV ограничен 500 МБ.

Повторные запуски, данные и задания

Подготовленные фрагменты, распознанный текст и готовая озвучка сохраняются в памяти вкладки. При ошибке или отмене повторный запуск продолжает незавершённые фрагменты: уже готовые не распознаются и не синтезируются снова. После полного завершения кнопка Синтезировать заново сохраняет текст и подготовленные образцы, но заново вызывает ElevenLabs для всех восстанавливаемых фрагментов. Замена исходной записи очищает весь этот кэш.

Heavy использует внешние сервисы распознавания и LLM. ElevenLabs получает каждый выбранный речевой фрагмент и его текст отдельно. Речевые фрагменты и расшифровка Heavy не добавляются в архив: распознавание запускается с privacyMode=true и externalAiConsent=true.

Новая озвучка использует авторизованные TTS-операции. Для каждого фрагмента создаётся отдельная операция. Они хранят временный референс и результат до завершения обработки фрагмента. После скачивания WAV в память вкладки содержимое операции и её временный голос удаляются до создания следующего голоса, чтобы не занять доступные слоты клонирования. При ошибке очистки обработка останавливается, а повторный запуск повторяет очистку без нового синтеза готового фрагмента. Клоны не добавляются в библиотеку голосов приложения. Для незавершённых операций остаётся серверная очистка по истечении срока хранения.

Кнопка отмены останавливает текущее серверное задание. Фрагменты обрабатываются последовательно, поэтому одновременно активно не более одного задания. Переключение вкладок Речевой студии сохраняет локальный результат. При уходе из студии или перезагрузке страницы несохранённые данные теряются. Запросы создания заданий автоматически не повторяются при неизвестном результате.

Стоимость складывается из распознавания Heavy и синтеза ElevenLabs v4 для каждого восстанавливаемого фрагмента. Тариф Heavy — 250 кредитов за минуту с минимумом 15 оплачиваемых секунд на каждый отдельный фрагмент. При курсе 0,04 ₽ за кредит это 10 ₽ за минуту и минимум 2,50 ₽ за фрагмент до 15 секунд. После минимума длительность округляется вверх до целой секунды. Большое количество фрагментов увеличивает число операций клонирования и распознавания и может увеличивать время обработки и затраты по сравнению с восстановлением записи одним голосом. Поиск речи Silero VAD и сохранение коротких исходных реплик не создают платных API-операций.