← Все статьи

Инструменты · Транскрибация

Транскрибация видео на русский: топ решений 2026 и как выбрать

10 минут чтения · Обзоры по официальной документации, публичным бенчмаркам WER 2024-2026 и практике монтажёров

Три года назад качественная транскрибация русской речи стоила от 30 ₽ за минуту и требовала ручной правки — сейчас это копейки за минуту и часто без правок вообще. Появление Whisper от OpenAI и обновления Яндекс SpeechKit сделали автоматическую транскрибацию рабочим инструментом для монтажёров, подкастеров, редакторов и SMM-специалистов.

Разбираем: какие технологии реально работают на русском в 2026, чем они отличаются по точности и цене, какие инструменты стоят внимания под разные задачи и когда стоит платить, а когда — брать бесплатное.

Зачем автоматическая транскрибация в 2026

Пять основных сценариев, которые окупают затраты на инструмент:

Технологии транскрибации на 2026

На рынке три основных «мозга», на которых работают все известные инструменты:

OpenAI Whisper

Открытая модель от OpenAI, доступна как API (~$0.006 за минуту) и как open-source (запуск локально бесплатно, требует GPU). Обученная на 680 000 часов многоязычных данных, включая ~10% русской речи.

Плюсы: отличная точность на чистой речи (WER ~4-6% на русском в тестах 2025), знает 100+ языков, автоматически определяет язык, word-level timestamps, стабильно работает с любыми акцентами.

Минусы: иногда сбивается на смешанной речи (русский + английские вкрапления → выдаёт транскрипт на английском). Решается принудительным указанием языка через параметр language="ru".

Яндекс SpeechKit

Собственная разработка Яндекса, обученная преимущественно на русскоязычных данных. Доступна как облачный API (~2-3 ₽ за минуту при пакете).

Плюсы: лидер по точности на разговорной русской речи в тестах Skoltech 2025 (WER ~3-5% на бытовых диалогах), понимает сленг, знает имена собственные, российскую топонимику. Российский хостинг — важно для B2B и медиа.

Минусы: дороже Whisper в 5-10 раз, менее развит на других языках, для смешанной русско-английской речи хуже Whisper.

Google Speech-to-Text

Классика от Google, есть версии Standard и Enhanced (~$0.016 за минуту). На русском работает, но заметно хуже двух первых.

Плюсы: стабильный API, хорошая интеграция с Google Cloud.
Минусы: WER на русской речи 8-15% в тестах 2025 — заметно хуже Whisper и SpeechKit. Актуален только если у вас уже вся инфраструктура на GCP.

Реальная точность на русском

По усреднённым бенчмаркам 2025-2026 (WER = word error rate, чем ниже — тем лучше):

Условия записи Whisper (large-v3) Яндекс SpeechKit Google STT
Студийный микрофон, чистая речь3-5%2-4%7-10%
Подкаст 2 спикера5-8%4-6%10-13%
Уличная запись, шум10-15%8-12%18-25%
Смешанная русско-английская6-9%15-20%12-16%

Для сравнения: ручная расшифровка у профи-транскрипционистов даёт WER 1-3%. То есть Whisper/SpeechKit уже в пределах человеческого качества на хороших записях.

Обзор инструментов

1. Descript

Западный лидер: транскрибация + редактирование видео как текста (удалили слово из транскрипта — исчезло из видео). Использует Whisper под капотом.

Цена: $15-30/мес.
Кому: англоязычным видеомонтажёрам премиум-сегмента.
Русский: работает, но UI без русской локализации, оплата через VPN.

2. Rev

Ветеран рынка. Раньше был лучшим для ручной расшифровки, сейчас предлагает и авто-режим. Для английского — топ, для русского — посредственно.

Цена: $8-30/мес.
Русский: формально поддержка есть, качество среднее.

3. Otter.ai

Заточен под транскрибацию звонков (Zoom, Meet, Teams). Реалтайм-субтитры во время встречи, автосохранение.

Цена: $8-20/мес.
Русский: ограниченная поддержка, лучше для английских звонков.

4. Whisper (open-source, локально)

Скачиваете модель, запускаете на своей машине. Бесплатно, но нужен GPU: на CPU 1 час аудио обрабатывается 30-60 минут, на GPU RTX 4090 — 3-5 минут.

Цена: 0 ₽ (плюс электричество и оборудование).
Кому: техническим специалистам, если много контента и есть железо.
Русский: отличный.

5. OpenAI Whisper API

Тот же Whisper, но в облаке OpenAI. Не нужно железо, платите за минуты.

Цена: $0.006 за минуту (~$0.36 за час).
Кому: разработчикам, интегрирующим в свой продукт.
Русский: отличный. Оплата — сложно из РФ, нужен зарубежный аккаунт.

6. Яндекс SpeechKit

Отечественная разработка, топ по русской речи в 2026. Прямая интеграция с Yandex Cloud.

Цена: ~2-3 ₽ за минуту в пакетах.
Кому: B2B, медиа-компаниям, где нужна юрисдикция РФ и топовая точность на русском.
Русский: лидер по бенчмаркам разговорной речи.

7. SberDevices SmartSpeech

Ответ Сбера — облачная транскрибация, интегрирована в GigaChat. Работает через MarketSber API.

Цена: ~2 ₽ за минуту.
Русский: хорошо, но чуть уступает SpeechKit по бенчмаркам.

8. VK Cloud Speech-to-Text

ML-платформа от VK. Молодой продукт, догоняет конкурентов. Хорош тем что интегрирован в экосистему VK для B2B-клиентов.

Цена: ~1.5-2.5 ₽ за минуту.
Русский: достойно, но менее точен на нишевой лексике.

9. Готовые продуктовые сервисы: ClipCraft, Reels-Boss

Не «чистая транскрибация», а полноценные инструменты, где транскрибация — часть пайплайна. ClipCraft (сервис, который вы читаете) использует Whisper с принудительным русским, ищет цепляющие моменты через GPT и режет 9:16-шортсы с караоке-субтитрами. Reels-Boss делает похожее с фокусом на массовый бизнес.

Цена: ClipCraft — от 15 ₽ за 10 минут исходника (включена и транскрибация, и нарезка).
Кому: тем, кому нужен не «текст», а сразу готовые вертикальные ролики. Транскрибация как «промежуточный шаг» скрыта.

10. Ручная расшифровка (биржи, фрилансеры)

Kwork, YouDo, FL.ru — от 5 до 30 ₽ за минуту. Плюс — почти нулевой WER на сложных записях (акценты, много спикеров, шум). Минус — часы ожидания, вариативность качества.

Кому: для юридических/медицинских записей, где критична точность на каждое слово.

Как выбрать инструмент под задачу

Четыре типовые ситуации:

Тонкости русскоязычной транскрибации

Три момента, которые чаще всего убивают качество:

  1. Собственные имена и термины. Whisper пишет «Дудь» как «дуть», SpeechKit — «Довлатов» как «Дувлатов». Решение: ручная правка первых 5-10 минут, потом модель адаптируется. Или использовать словари (SpeechKit это позволяет через custom dictionary).
  2. Смешанный язык. «Мы деплоим фиче-бранч в staging» — Whisper иногда путается и определяет весь файл как английский. Всегда задавайте language="ru" в параметрах.
  3. Плохой микрофон. Никакая модель не спасёт запись с встроенного микрофона MacBook на расстоянии 2 метров. Минимум — петличка Xiaomi за 1500 ₽, оптимально — Rode NT-USB Mini или аналог.

FAQ

Whisper и Яндекс SpeechKit — что реально точнее на русском?
На чистой студийной речи разница 1-2% (SpeechKit чуть впереди), на «уличных» записях разница до 5% (SpeechKit заметно лучше). На смешанной русско-английской речи наоборот — Whisper лучше.

Стоит ли покупать Yandex SpeechKit если можно взять бесплатный Whisper локально?
Если у вас 100+ часов аудио в месяц и есть железо — Whisper локально. Меньше 100 часов или нет GPU — SpeechKit / Whisper API. Экономика разная.

Как быстро транскрибировать 3-часовое интервью?
Whisper API — 3-5 минут (параллельные чанки), SpeechKit — примерно так же, Whisper локально на GPU — 5-10 минут, на CPU — 1.5-2.5 часа. Не забудьте про Whisper-лимит в 25MB на файл (нужно разбивать длинные записи на чанки).

Как быть с смешанной русско-английской речью (IT-подкасты)?
Принудительно задавайте language="ru" в Whisper — тогда английские слова пишутся так, как произносятся кириллицей («деплой», «фича», «стейджинг»). Это часто удобнее чем смешанные буквы.

Что делать если нужен транскрипт для суда/юридического использования?
Автоматика не подходит — WER даже 3% может испортить смысл. Только ручная расшифровка (Rev, биржи) с последующей вычиткой юриста. Автоматика полезна как черновик для ускорения.

ClipCraft использует Whisper с принудительным русским, GPT для поиска цепляющих моментов и ffmpeg для нарезки в 9:16 с караоке-субтитрами. Транскрибация встроена в пайплайн — вы получаете сразу готовые вертикальные шортсы, а не «просто текст».

Попробовать бесплатно