Распознавайте длинные записи и превращайте разговоры в текст и готовые материалы
Загрузите аудио, видео или ссылку. Получите транскрипт с разделением участников, исследовательский отчёт, итоги встречи или готовый контент. Выводы можно проверить по исходным цитатам и таймкодам.
Файловое распознавание на шести языках: русском, английском, казахском, кыргызском, узбекском и таджикском.
Русскоязычные записи с диктофона на 12+ часов — одним файлом.
Расшифровать бесплатно Посмотреть пример отчёта Новости
Стартовые кредиты после регистрации — без привязки карты. Актуальный объём бесплатной обработки указан в блоке «Бесплатный старт».
Перевод и дубляж аудио и видео
Тот же разговор — на другом языке и голосами его участников
Загрузите аудио, видео или вставьте публичную ссылку. Speech Expert разделит речь по спикерам, переведёт реплики, озвучит их по голосовым образцам из исходной записи при наличии подходящего голосового фрагмента и постарается сохранить исходный тайминг.
YouTube · VK Видео · VK Play · RuTube · Яндекс Видео · Дзен · Одноклассники · Vimeo
- Разделение спикеров и распознавание речи.
- Перевод реплик и укладка в тайминг разговора.
- Озвучка реплик по голосовым образцам участников.
- Готовая WAV-дорожка и MP4, когда у источника доступен видеоряд.
Для каждой реплики остаются доступны оригинал, перевод, спикер, таймкод и предупреждения. Исправляйте текст, спикера и тайминг прямо в редакторе, передублируйте только изменённый фрагмент и скачивайте переведённые SRT/VTT или двуязычный транскрипт.
Если для спикера недостаточно подходящего голосового фрагмента, его исходная реплика сохраняется без дубляжа.
Для запуска нужно подтвердить право использовать и клонировать голоса участников.
По ссылке работают только публично доступные ролики; доступность зависит от площадки. Если MP4 собрать нельзя, перевод останется доступен в WAV.
Посмотрите, что получается на выходе
В демонстрационном примере на синтетических данных доступны пять представлений одного результата:
- транскрипт с участниками и таймкодами;
- исследовательский отчёт с темами, задачами пользователей, возражениями и источниками;
- итоги встречи с решениями, задачами и открытыми вопросами;
- контент-пакет со статьёй, тезисами и публикациями;
- структурированный JSON для интеграции через API.
Открыть синтетический пример исследовательского отчёта
Выберите результат под свою задачу
- Исследования: темы, задачи пользователей, возражения и проверяемые выводы по серии из 2–20 интервью.
- Встречи и звонки: резюме, решения, задачи и открытые вопросы; для русской речи — вероятностная эмоциональная динамика.
- Вебинары и подкасты: статья, главы, тезисы, описание выпуска и публикации.
- Для разработчиков: файловое распознавание
ru-RU,en-US,kk-KZ,ky-KG,uz-UZиtg-TJ; живые WebSocket и gRPC — для русского.
Не просто саммари — ключевые выводы, решения и задачи можно проверить
Нажмите на пункт, чтобы открыть подтверждающую цитату. Когда данные доступны, источник также показывает спикера и таймкод.
Открыть полный пример исследовательского отчёта
«А почему просто не запустить Whisper и не отправить текст в ChatGPT?»
Для одной или нескольких разовых записей это действительно рациональное решение. Speech Expert нужен не потому, что Whisper плохо распознаёт, а ChatGPT плохо пересказывает.
Разница появляется, когда процесс становится регулярным — и особенно когда диктофонная запись длится 12 часов и более. Whisper остаётся моделью: вокруг неё нужно организовать передачу файла, разбиение, контроль прогресса и согласованную склейку таймкодов.
В режиме потокового распознавания вы загружаете один русскоязычный файл до 10 ГБ без ручной нарезки. Выбранная модель формирует текст и таймкоды по мере обработки записи.
Результат потокового режима — текст и таймкоды для экспорта. Разделение участников, LLM-коррекция, фоновая обработка и возобновление пока не поддерживаются.
Для записей под NDA маршрут обработки виден до запуска: для пяти языков можно выбрать модель в контуре Speech Expert, а в приватном режиме не разрешать внешние текстовые этапы.
Распознавание файлов на шести языках
SpeechExpert-STT — собственная разработка Speech Expert для русской речи. В контуре Speech Expert также доступны GigaAM Multilingual для русского, казахского, кыргызского и узбекского и серверный Whisper для русского и английского. При выборе этих моделей аудио не передаётся внешнему STT-провайдеру.
Gemini 3.5 Transcribe через Google API и ElevenLabs Scribe v2 — внешние STT-модели для всех шести языков, включая таджикский. Выбранная модель и маршрут обработки видны до запуска.
Язык саммари можно выбрать отдельно, а полный перевод сохранить рядом с исходным транскриптом и его таймкодами.
Распознавание русскоязычных записей продолжительностью 12 часов и более
Выберите один многочасовой или диктофонный файл до 10 ГБ — заранее делить его на части не нужно. Браузер передаёт запись потоково: текст и таймкоды появляются по мере обработки, а кредиты списываются за уже обработанную длительность.
Режим: русская речь без разделения участников и автоматической коррекции текста. Вкладка должна оставаться открытой до завершения; при обрыве обработку нужно запустить заново.
Эмоциональная динамика русской речи
Speech Expert отмечает вероятностные эмоциональные эпизоды и связывает их с таймкодом, репликой и — при однозначной атрибуции — спикером.
Это сигнал для выбора фрагмента и ручной проверки исходного аудио, а не оценка состояния или намерений человека. Его нельзя использовать как основание кадровых, медицинских, кредитных или страховых решений.
Для команд
Нужно обработать серию интервью или встроить Speech Expert в рабочий процесс? До старта согласуем объём, формат результата и критерии проверки.
Когда нужен свой speech-инженер, а когда достаточно готового сервиса
Обсудить пилот Обсудить API-интеграцию
Вы управляете хранением и внешней обработкой
В приватном режиме результат не добавляется в архив, а временные данные обработки удаляются после завершения. Google API или ElevenLabs получают аудио только при выборе соответствующей внешней STT-модели; LLM-коррекция, извлечение сущностей, отчёты и перевод передают текст настроенному провайдеру. В приватном режиме эти этапы выключены до отдельного разрешения.
Для обычной записи исходное аудио можно удалить отдельно, сохранив транскрипт и готовые материалы.
Понятная стоимость в рублях
Ставка модели:
- SpeechExpert-STT — около 0,17 ₽ за минуту.
- GigaAM Multilingual — около 0,35 ₽ за минуту.
- ElevenLabs Scribe v2 — около 1,17 ₽ за минуту; разделение участников включено.
- Gemini 3.5 Transcribe — около 1,17 ₽ за минуту; нативная диаризация без доплаты.
- Озвучка — около 0,17 ₽ за минуту готовой речи.
Дополнительная опция: разделение участников — ещё около 0,15 ₽ за минуту для моделей без встроенной разметки спикеров.
Ориентир: GigaAM с разделением участников — около 0,50 ₽ за минуту (около 0,35 ₽ модель + около 0,15 ₽ опция), или около 30 ₽ за 60 минут.
Операции округляются до начатой секунды. Итоговая ставка выбранной модели и опций показывается до запуска.
Озвучьте длинный текст или диалог одним запуском
Добавьте текст длиной до 40 000 символов — Speech Expert автоматически разделит его по фразам примерно по 500 символов.
Простой синтез с готовой склейкой
Фрагменты последовательно генерируются одним голосом или разными голосами по ролям, а затем объединяются в единый WAV с выбранной паузой между фразами.
Подходит для озвучки длинных лекций, учебных материалов, статей, отдельных глав и диалогов ведущего с гостями.
Режим «По ролям»: назначьте голос ведущему, эксперту или персонажам — порядок реплик, прогресс и частичный результат сохраняются на сервере.
- Вставьте текст и выберите один голос либо настройте роли.
- Настройте паузу между фразами и запустите синтез.
- Прослушайте результат и скачайте собранный WAV.
Используйте только свой голос или голос спикера, который дал согласие.
Частые вопросы
Какие языки поддерживает распознавание?
Файловый профиль распознаёт русскую, английскую, казахскую, кыргызскую, узбекскую и таджикскую речь. SpeechExpert-STT — собственная разработка Speech Expert для русской речи. Внешние Gemini 3.5 Transcribe и ElevenLabs Scribe v2 поддерживают все шесть языков, включая таджикский. Живой поток сейчас доступен для русского; автоматического определения языка нет.
Какие форматы поддерживаются?
Поддерживаются распространённые аудио- и видеоформаты, включая WAV с PCM- и IEEE Float-сэмплами, MP3, M4A, OGG, WebM, FLAC, MP4, MOV и MKV.
Можно ли распознать русскоязычную диктофонную запись на 12 часов и больше?
Да. В режиме потокового распознавания выберите один русскоязычный аудиофайл до 10 ГБ — заранее разрезать его не нужно. Выбранная модель формирует текст и таймкоды по мере обработки. Разделение участников и автоматическая коррекция текста недоступны; вкладку браузера нужно оставить открытой до завершения. После обрыва запуск начинается заново.
Насколько точно разделяются участники?
Для большинства mono-моделей можно указать до 20 участников; Gemini определяет до восьми спикеров автоматически. Качество зависит от шума, микрофонов и одновременной речи, поэтому рекомендуем проверить несколько собственных записей.
Какие данные передаются внешним провайдерам?
Google API или ElevenLabs получают аудио только при выборе соответствующей внешней STT-модели; коррекция, извлечение сущностей, отчёты и перевод могут передавать текст настроенному LLM-провайдеру. В приватном режиме эти этапы требуют отдельного разрешения.
Можно ли удалить исходное аудио?
Да. Можно удалить только аудио, сохранив транскрипт, источники, отчёты и готовые материалы, либо удалить запись полностью.
Есть ли API?
Да. Доступны REST, SSE, WebSocket и gRPC; поддерживаются OpenAI- и SpeechKit-совместимые методы.
Как рассчитываются кредиты?
Один кредит соответствует 0,04 ₽. Ставка зависит от модели. Для моделей без встроенной разметки разделение участников добавляет около 0,15 ₽ за минуту. SpeechExpert-STT с разделением стоит около 0,32 ₽ за минуту, GigaAM — около 0,50 ₽, ElevenLabs Scribe v2 и Gemini 3.5 Transcribe с нативной разметкой — около 1,17 ₽. Итоговая ставка видна до запуска.
Сколько можно обработать бесплатно после регистрации?
После подтверждения регистрации начислим 1 000 кредитов. Этого хватит примерно на 238 минут SpeechExpert-STT без разделения участников или до пяти интервью по 25 минут с разделением. Это альтернативные примеры расходования одного бонуса.
Можно ли обработать серию интервью?
Да. В один исследовательский отчёт можно объединить от 2 до 20 сохранённых транскриптов.
Можно ли работать от юридического лица?
Да. Условия пилота и API-интеграции можно согласовать по адресу info@speech-expert.ru.
Получите первый результат на своей записи
1 000 кредитов после подтверждения регистрации: примерно 238 минут SpeechExpert-STT без разделения участников или до пяти интервью по 25 минут с разделением. Без привязки карты.
Расшифровать бесплатно Запросить пилот для команды Документация