Инструменты · Транскрибация
Транскрибация видео на русский: топ решений 2026 и как выбрать
Три года назад качественная транскрибация русской речи стоила от 30 ₽ за минуту и требовала ручной правки — сейчас это копейки за минуту и часто без правок вообще. Появление Whisper от OpenAI и обновления Яндекс SpeechKit сделали автоматическую транскрибацию рабочим инструментом для монтажёров, подкастеров, редакторов и SMM-специалистов.
Разбираем: какие технологии реально работают на русском в 2026, чем они отличаются по точности и цене, какие инструменты стоят внимания под разные задачи и когда стоит платить, а когда — брать бесплатное.
Зачем автоматическая транскрибация в 2026
Пять основных сценариев, которые окупают затраты на инструмент:
- Субтитры к видео. Для соцсетей 85% зрителей смотрят без звука — субтитры превратились из «доступности» в базовое требование.
- Нарезка длинных видео на шортсы. Без transcript'а с word-level таймингами невозможно точно найти начало и конец «сильной» фразы.
- Тексты для блога/статей. Один час подкаста = 8-10 тыс. слов. Ручная расшифровка — 4-6 часов работы, автоматическая — 2-5 минут.
- Поиск по видео-архиву. Транскрипт индексируется — можно искать фразы по всей библиотеке своих записей.
- Автоматический перевод. Сначала транскрипт на исходном, потом GPT/Google переводит на любой язык.
Технологии транскрибации на 2026
На рынке три основных «мозга», на которых работают все известные инструменты:
OpenAI Whisper
Открытая модель от OpenAI, доступна как API (~$0.006 за минуту) и как open-source (запуск локально бесплатно, требует GPU). Обученная на 680 000 часов многоязычных данных, включая ~10% русской речи.
Плюсы: отличная точность на чистой речи (WER ~4-6% на русском в тестах 2025), знает 100+ языков, автоматически определяет язык, word-level timestamps, стабильно работает с любыми акцентами.
Минусы: иногда сбивается на смешанной речи (русский + английские вкрапления → выдаёт транскрипт на английском). Решается принудительным указанием языка через параметр language="ru".
Яндекс SpeechKit
Собственная разработка Яндекса, обученная преимущественно на русскоязычных данных. Доступна как облачный API (~2-3 ₽ за минуту при пакете).
Плюсы: лидер по точности на разговорной русской речи в тестах Skoltech 2025 (WER ~3-5% на бытовых диалогах), понимает сленг, знает имена собственные, российскую топонимику. Российский хостинг — важно для B2B и медиа.
Минусы: дороже Whisper в 5-10 раз, менее развит на других языках, для смешанной русско-английской речи хуже Whisper.
Google Speech-to-Text
Классика от Google, есть версии Standard и Enhanced (~$0.016 за минуту). На русском работает, но заметно хуже двух первых.
Плюсы: стабильный API, хорошая интеграция с Google Cloud.
Минусы: WER на русской речи 8-15% в тестах 2025 — заметно хуже Whisper и SpeechKit. Актуален только если у вас уже вся инфраструктура на GCP.
Реальная точность на русском
По усреднённым бенчмаркам 2025-2026 (WER = word error rate, чем ниже — тем лучше):
| Условия записи | Whisper (large-v3) | Яндекс SpeechKit | Google STT |
|---|---|---|---|
| Студийный микрофон, чистая речь | 3-5% | 2-4% | 7-10% |
| Подкаст 2 спикера | 5-8% | 4-6% | 10-13% |
| Уличная запись, шум | 10-15% | 8-12% | 18-25% |
| Смешанная русско-английская | 6-9% | 15-20% | 12-16% |
Для сравнения: ручная расшифровка у профи-транскрипционистов даёт WER 1-3%. То есть Whisper/SpeechKit уже в пределах человеческого качества на хороших записях.
Обзор инструментов
1. Descript
Западный лидер: транскрибация + редактирование видео как текста (удалили слово из транскрипта — исчезло из видео). Использует Whisper под капотом.
Цена: $15-30/мес.
Кому: англоязычным видеомонтажёрам премиум-сегмента.
Русский: работает, но UI без русской локализации, оплата через VPN.
2. Rev
Ветеран рынка. Раньше был лучшим для ручной расшифровки, сейчас предлагает и авто-режим. Для английского — топ, для русского — посредственно.
Цена: $8-30/мес.
Русский: формально поддержка есть, качество среднее.
3. Otter.ai
Заточен под транскрибацию звонков (Zoom, Meet, Teams). Реалтайм-субтитры во время встречи, автосохранение.
Цена: $8-20/мес.
Русский: ограниченная поддержка, лучше для английских звонков.
4. Whisper (open-source, локально)
Скачиваете модель, запускаете на своей машине. Бесплатно, но нужен GPU: на CPU 1 час аудио обрабатывается 30-60 минут, на GPU RTX 4090 — 3-5 минут.
Цена: 0 ₽ (плюс электричество и оборудование).
Кому: техническим специалистам, если много контента и есть железо.
Русский: отличный.
5. OpenAI Whisper API
Тот же Whisper, но в облаке OpenAI. Не нужно железо, платите за минуты.
Цена: $0.006 за минуту (~$0.36 за час).
Кому: разработчикам, интегрирующим в свой продукт.
Русский: отличный. Оплата — сложно из РФ, нужен зарубежный аккаунт.
6. Яндекс SpeechKit
Отечественная разработка, топ по русской речи в 2026. Прямая интеграция с Yandex Cloud.
Цена: ~2-3 ₽ за минуту в пакетах.
Кому: B2B, медиа-компаниям, где нужна юрисдикция РФ и топовая точность на русском.
Русский: лидер по бенчмаркам разговорной речи.
7. SberDevices SmartSpeech
Ответ Сбера — облачная транскрибация, интегрирована в GigaChat. Работает через MarketSber API.
Цена: ~2 ₽ за минуту.
Русский: хорошо, но чуть уступает SpeechKit по бенчмаркам.
8. VK Cloud Speech-to-Text
ML-платформа от VK. Молодой продукт, догоняет конкурентов. Хорош тем что интегрирован в экосистему VK для B2B-клиентов.
Цена: ~1.5-2.5 ₽ за минуту.
Русский: достойно, но менее точен на нишевой лексике.
9. Готовые продуктовые сервисы: ClipCraft, Reels-Boss
Не «чистая транскрибация», а полноценные инструменты, где транскрибация — часть пайплайна. ClipCraft (сервис, который вы читаете) использует Whisper с принудительным русским, ищет цепляющие моменты через GPT и режет 9:16-шортсы с караоке-субтитрами. Reels-Boss делает похожее с фокусом на массовый бизнес.
Цена: ClipCraft — от 15 ₽ за 10 минут исходника (включена и транскрибация, и нарезка).
Кому: тем, кому нужен не «текст», а сразу готовые вертикальные ролики. Транскрибация как «промежуточный шаг» скрыта.
10. Ручная расшифровка (биржи, фрилансеры)
Kwork, YouDo, FL.ru — от 5 до 30 ₽ за минуту. Плюс — почти нулевой WER на сложных записях (акценты, много спикеров, шум). Минус — часы ожидания, вариативность качества.
Кому: для юридических/медицинских записей, где критична точность на каждое слово.
Как выбрать инструмент под задачу
Четыре типовые ситуации:
- Мне нужны субтитры к своим роликам в соцсети. ClipCraft (если нужны шортсы под соцсети) или CapCut / VideoLeap (если делаете руками). Оба используют Whisper под капотом.
- Мне нужен текст из подкаста для статьи в блог. Whisper API (если готовы платить в валюте) или Яндекс SpeechKit (если из РФ). SpeechKit точнее на русском, Whisper дешевле.
- Мне нужна транскрибация звонков команды. Otter.ai (для англоязычных встреч) или Яндекс SpeechKit + собственная интеграция (для рус).
- Мне нужно много и стабильно, есть железо. Whisper локально (open-source, бесплатно). Требует GPU и настройки, окупается при 100+ часов в месяц.
Тонкости русскоязычной транскрибации
Три момента, которые чаще всего убивают качество:
- Собственные имена и термины. Whisper пишет «Дудь» как «дуть», SpeechKit — «Довлатов» как «Дувлатов». Решение: ручная правка первых 5-10 минут, потом модель адаптируется. Или использовать словари (SpeechKit это позволяет через custom dictionary).
- Смешанный язык. «Мы деплоим фиче-бранч в staging» — Whisper иногда путается и определяет весь файл как английский. Всегда задавайте
language="ru"в параметрах. - Плохой микрофон. Никакая модель не спасёт запись с встроенного микрофона MacBook на расстоянии 2 метров. Минимум — петличка Xiaomi за 1500 ₽, оптимально — Rode NT-USB Mini или аналог.
FAQ
Whisper и Яндекс SpeechKit — что реально точнее на русском?
На чистой студийной речи разница 1-2% (SpeechKit чуть впереди), на «уличных» записях разница до 5% (SpeechKit заметно лучше). На смешанной русско-английской речи наоборот — Whisper лучше.
Стоит ли покупать Yandex SpeechKit если можно взять бесплатный Whisper локально?
Если у вас 100+ часов аудио в месяц и есть железо — Whisper локально. Меньше 100 часов или нет GPU — SpeechKit / Whisper API. Экономика разная.
Как быстро транскрибировать 3-часовое интервью?
Whisper API — 3-5 минут (параллельные чанки), SpeechKit — примерно так же, Whisper локально на GPU — 5-10 минут, на CPU — 1.5-2.5 часа. Не забудьте про Whisper-лимит в 25MB на файл (нужно разбивать длинные записи на чанки).
Как быть с смешанной русско-английской речью (IT-подкасты)?
Принудительно задавайте language="ru" в Whisper — тогда английские слова пишутся так, как произносятся кириллицей («деплой», «фича», «стейджинг»). Это часто удобнее чем смешанные буквы.
Что делать если нужен транскрипт для суда/юридического использования?
Автоматика не подходит — WER даже 3% может испортить смысл. Только ручная расшифровка (Rev, биржи) с последующей вычиткой юриста. Автоматика полезна как черновик для ускорения.
ClipCraft использует Whisper с принудительным русским, GPT для поиска цепляющих моментов и ffmpeg для нарезки в 9:16 с караоке-субтитрами. Транскрибация встроена в пайплайн — вы получаете сразу готовые вертикальные шортсы, а не «просто текст».
Попробовать бесплатно