Восстановление плохих записей на русском и узбекском
Шумный звонок, тихая запись встречи или интервью с искажениями могут дать разные расшифровки у разных моделей. В Speech Expert появился режим «Восстановление плохого аудио»: он распознаёт одну запись тремя системами, сопоставляет их варианты и собирает итоговый текст. Пока доступны русский и узбекский языки.
Три расшифровки для одной записи
Для русского используются Whisper, FastConformer и ElevenLabs Scribe. Для узбекского — ElevenLabs Scribe, FastConformer UZ и GigaAM UZ 0.6. Набор выбирается по языку автоматически: запускать модели по очереди и вручную сравнивать результаты не нужно.
Затем языковая модель через VseGPT сопоставляет варианты одних и тех же фрагментов. Её задача — сохранить сказанное и выбрать подтверждённые слова. Для мест, которые не удаётся надёжно согласовать, предусмотрены пометки «[неразборчиво]» и «[tushunarsiz]». Результат — восстановленный транскрипт; исходный звук не изменяется.
Как включить восстановление
- В кабинете откройте распознавание и загрузите аудио- или видеофайл.
- Выберите русский или узбекский в поле «Язык записи».
- Включите «Восстановление плохого аудио», проверьте стоимость и нажмите «Распознать».
- После обработки прочитайте итоговый текст и сравните спорные места с исходными вариантами распознавания.
Обработка выполняется в фоне. В результате доступны варианты моделей и предупреждения, если часть распознаваний оказалась недоступна. Если для фрагмента получен только один вариант, он сохраняется без согласования с другими моделями, а результат отмечается как неполный.
Когда пригодится этот режим
Попробуйте восстановление на записи, где обычное распознавание пропускает слова или даёт спорные формулировки. Для оценки качества удобно начать с небольшого характерного фрагмента. Сравнение моделей помогает проверить трудные места, но не гарантирует точность неразборчивой речи: важные имена, числа и цитаты стоит сверять с записью.
Сейчас режим выдаёт общий текст без разделения говорящих и точных пословных таймкодов. Каналы записи сводятся в одну дорожку. Восстановление работает с готовыми файлами; живые субтитры и режим «Текст по мере обработки» его не используют.
Стоимость и обработка данных
Тариф включает три распознавания и согласование текста через VseGPT, поэтому стоимость выше, чем при запуске одной модели. Расчёт показан до начала обработки. Если часть распознаваний недоступна, действует тот же тариф режима.
Для этого режима аудио передаётся ElevenLabs, а варианты текста — VseGPT. При работе в приватном режиме требуется разрешение на внешнюю AI-обработку.
Открыть кабинет · Подробнее о восстановлении и подключении через API