Расшифровка аудио · сентябрь 2026
Чем расшифровать аудио в текст: 3 способа для русской речи в 2026
Расшифровать аудио в текст можно тремя честными способами: бесплатно и локально через Whisper, бесплатно с лимитом через онлайн-сервис вроде speech2text.ru, или платно по минутам через сервис вроде Otter.ai. Я прогнал свою запись через Whisper на Маке и 3 сентября 2026 года снял тарифы у обоих онлайн-вариантов
Ниже - что выбрать под свою задачу и что честно неидеально в каждом варианте. Если запись - это видео, а результат нужен субтитрами поверх картинки, а не отдельным текстовым файлом, это другая задача - она разобрана в гайде нейросеть делает субтитры к видео
К концу статьи ты будешь знать: чем локальная расшифровка отличается от онлайн-сервиса на практике, сколько стоит расшифровка часа записи в каждом из трёх вариантов, и на что обращать внимание, если записей у тебя не одна, а архив за месяцы
Посчитай две вещи прежде чем выбирать: сколько минут записи набегает у тебя за месяц и должна ли запись остаться только на твоём компьютере. Меньше 300 минут и конфиденциальность не критична - хватит бесплатного онлайн-лимита. Больше или запись приватная - ставь Whisper локально, он бесплатен без ограничения по объёму
Какая у тебя запись и что с ней дальше
Голосовое на минуту и архив из двухсот часов старых созвонов - разные задачи, даже если инструмент один и тот же. Перед выбором стоит понять две вещи про свою запись: сколько она длится и что будет с текстом дальше
Если запись одна и короткая - подойдёт любой из трёх путей, разница будет в паре минут ожидания. Если записей много и они копятся регулярно - каждая минута платного сервиса складывается в заметную сумму, и локальный вариант начинает выигрывать по деньгам уже на первом же месяце архива
Готовый текст обычно нужен не сам по себе, а для следующего шага: конспект лекции, тезисы встречи, черновик статьи. Если тебе именно это и нужно после расшифровки - соседний гайд нейросеть конспект: от часа лекции до тезисов забирает эстафету ровно там, где заканчивается эта статья
Путь 2. Онлайн-сервис с бесплатным лимитом: без установки, но с потолком
speech2text.ru - один из готовых сайтов, где запись загружается через браузер и текст приходит через несколько минут, без установки программы на компьютер
По официальной странице сервиса, после регистрации даётся «бесплатные 3 часа транскрибации», а до регистрации можно посмотреть демонстрацию расшифровки бесплатно и без входа в аккаунт. Три часа - это заметный запас для разовой задачи: конспект одной лекции, расшифровка одного созвона, один архив голосовых за неделю
Три шага, если выбираешь этот путь:
- Зайди на сайт сервиса и зарегистрируйся. Обычно достаточно почты - это открывает бесплатный лимит в часах
- Загрузи файл записи через браузер. Кнопка загрузки на сайте принимает обычные форматы звука - m4a, mp3, wav
- Дождись готового текста. Время ожидания зависит от длины записи и загрузки сервиса в момент отправки - минуты, не секунды, как у локального Whisper
Что это даёт: не нужно ничего ставить на компьютер, работает из браузера на любом устройстве, включая телефон. Обратная сторона - лимит конечен, и когда бесплатные часы кончатся, дальше уже по тарифу сервиса, а конкретные цены после бесплатного лимита на публичной странице явно не расписаны - их стоит уточнять прямо перед тем, как лимит подойдёт к концу
Продолжение темы у меня разобрано отдельно: 4 задачи, где помощник экономит часы в 2026
Путь 3. Платная подписка по минутам: удобство встреч и командной работы
Otter.ai - готовое приложение для регулярных встреч, где расшифровка идёт не разовой загрузкой файла, а встроена прямо в процесс звонка
По официальной странице тарифов, бесплатный план даёт «300 monthly transcription minutes» и «3 lifetime audio/video file imports» - триста минут расшифровки в месяц и всего три загрузки готовых файлов за всё время существования аккаунта. Платный план Pro стоит 16.99 доллара в месяц и включает «1200 in-app recording minutes» и «10 monthly audio/video file imports» - в четыре раза больше минут и заметно больше загрузок
| План Otter.ai | Минут расшифровки в месяц | Загрузок готовых файлов | Цена |
|---|---|---|---|
| Бесплатный | 300 | 3 за всё время аккаунта | 0 |
| Pro | 1200 | 10 в месяц | 16.99 доллара/мес |
Таблица прокручивается вбок →
Что это даёт: удобство встроенной записи прямо во время звонка, без отдельного шага «сохранить файл и куда-то его загрузить». Обратная сторона - это подписка, и она рассчитана на регулярную работу командой, а не на разовую расшифровку одной старой записи. Оплата зарубежной подписки из России - отдельный вопрос, он разобран в общем виде в гайде нужна ли иностранная карта для сервисов вроде Claude: логика оплаты у большинства зарубежных подписок похожая
Во сколько выходит расшифровка часа записи в трёх вариантах
Чтобы сравнение было честным, а не просто «одно бесплатно, другое платно», стоит прикинуть цену на конкретном объёме - один час записи:
| Путь | Час записи стоит | Что при этом происходит с файлом |
|---|---|---|
| Whisper локально | 0 рублей после установки | остаётся на твоём компьютере |
| speech2text.ru, в пределах бесплатных 3 часов | 0 рублей | загружается на сервер сервиса |
| Otter.ai, бесплатный план (в пределах 300 мин/мес) | 0 рублей | загружается на сервер сервиса |
| Otter.ai, план Pro | входит в 16.99 доллара/мес за 1200 минут | загружается на сервер сервиса |
Таблица прокручивается вбок →
Для разработчиков: API по минутам и более точные зарубежные модели
Есть и вариант для тех, кто готов подключать расшифровку через код, а не через готовую кнопку на сайте: сервисы вроде OpenAI или Яндекс SpeechKit продают распознавание речи как отдельную услугу для разработчиков, по цене за минуту записи. У OpenAI это 0.006 доллара за минуту у полной модели Whisper и 0.003 доллара у более лёгкой gpt-4o-mini-transcribe - то есть 0.36 и 0.18 доллара за час записи соответственно (цены сняты с официальной страницы platform.openai.com, независимо подтверждённая соседней статьёй про Whisper 30.08.2026). У Яндекс SpeechKit цена начинается от 10 рублей за минуту распознавания, с бесплатным пробным периодом на месяц для нового аккаунта. Оба варианта - это не готовое приложение с кнопкой «загрузи файл», а инструмент для тех, кто сам пишет код или нанимает того, кто напишет
Есть и более точные модели распознавания у зарубежных нейросетей вроде Gemini или GPT, но доступ к ним из России обычно требует VPN и карту иностранного банка - для честной задачи «загрузил файл и получил текст без лишних препятствий» три пути этой статьи проще и доступнее
Смежная часть работы разобрана в гайде Mac mini на M6 в 2026 году: цена в рублях, 4 варианта
На что смотреть, если записей не одна, а архив
Двести часов старых голосовых по цене поминутного API вышли бы в 72 доллара и загрузку каждого файла постороннему сервису - разница между тремя путями сильнее всего видна именно на архиве, а не на одной короткой записи. У локального Whisper та же работа - это один вечер работы компьютера и ноль рублей, потому что лимита по количеству расшифровок у бесплатной программы попросту нет. Такой же принцип «поставил один раз - пользуешься бесплатно» работает и для других задач: подборка похожих находок собрана в гайде Claude Code бесплатно: находки вместо платного софта
Если записи приходят регулярно, а не разовым архивом - три вещи стоит проверить у себя, прежде чем выбирать путь:
Три вопроса перед выбором инструмента для регулярной расшифровки
- Сколько минут в месяц набегает меньше 300 - хватит бесплатного плана онлайн-сервиса, больше - выгоднее локальный вариант или платная подписка
- Важна ли конфиденциальность записи если запись не должна покидать твой компьютер - только локальный Whisper решает это по построению
- Нужна ли встроенная запись во время звонка если да - готовое приложение вроде Otter.ai удобнее, чем отдельный шаг «сохранить файл и загрузить»
Регулярный поток файлов - это ровно тот случай, где помощнику стоит один раз объяснить порядок действий и дальше не повторять его руками. Про то, как записать такой порядок в отдельный навык помощника, который срабатывает сам по просьбе словами - отдельный разбор, не про расшифровку конкретно, а про устройство навыков целиком
Какие форматы записи принимает каждый путь
Три пути этой статьи работают с одними и теми же форматами звука - голосовое из мессенджера (m4a, ogg), запись с диктофона (wav), файл с телефона (mp3). Разница не в том, ЧТО они принимают, а в том, КАК файл туда попадает
У Whisper локально файл просто указывается программе - он читает звук напрямую с диска, поддержка форматов идёт через вторую программу для звука, которая устанавливается рядом. У онлайн-сервисов файл загружается через кнопку в браузере, форматы принимаются те же, просто путь до расшифровки короче на один шаг - открыл страницу, перетащил файл, дождался
Отдельный случай - звук из видео. Все три пути умеют вытащить звуковую дорожку и расшифровать именно её, отдельно превращать видео в аудио перед загрузкой не требуется - об этом заранее заботится сам сервис или программа. Если видео нужно ещё и порезать по смыслу, а не только расшифровать - соседний разбор Claude и монтаж видео: нарезка записи показывает, как это делать словами, без программы монтажа
Запись с несколькими голосами: интервью, созвон, встреча
Простая расшифровка превращает запись с двумя и больше говорящими в сплошной текст без разделения, кто что сказал - подходит для конспекта общего смысла, но не годится, если важно понять реплики по отдельности
Разделение голосов по говорящим называется диаризацией, и не все три пути умеют её одинаково. Готовые приложения вроде Otter.ai, заточенные под встречи, обычно размечают реплики по спикерам прямо во время звонка - это часть их основной задачи. У локального Whisper в базовой команде такой разметки нет, она добавляется отдельным дополнительным шагом поверх обычной расшифровки
Что это тебе даёт при выборе: если задача - разово понять содержание разговора, подойдёт любой путь. Если важно точно знать, кто из участников что сказал - удобнее готовое приложение для встреч, где разделение голосов идёт из коробки
Telegram и мессенджеры: расшифровка прямо в переписке
Telegram Premium даёт четвёртый вариант расшифровки - встроенную функцию прямо внутри мессенджера, без отдельного файла и отдельного сайта. Результат появляется прямо под голосовым сообщением одной кнопкой
Кроме встроенной функции существуют сторонние боты с похожей задачей и бесплатным дневным лимитом - они работают отдельно от официального Premium и не входят в основное сравнение этой статьи, потому что качество и надёжность стороннего бота я лично не проверял
Этот путь удобен для одного конкретного случая: голосовое от коллеги или друга, которое проще прочитать, чем прослушать в шумном месте. Для регулярной рабочей расшифровки записей на компьютере три пути выше подходят лучше
Что теряется при переводе речи в текст
Готовый текст - не полная копия звука, а его упрощённая версия даже у самой точной модели. Три вещи теряются почти всегда, и это стоит знать заранее, а не удивляться потом:
Что не переносится в текст при любой расшифровке
- Интонация и эмоция текст не показывает, было ли сказано серьёзно или с иронией - это решается только прослушиванием оригинала
- Паузы и запинки большинство расшифровок сглаживают живую речь в читаемый текст, убирая «э-э» и обрывы фразы
- Кто именно говорит без явного разделения без диаризации несколько голосов сливаются в один сплошной текст
Для рабочих заметок и конспекта это не проблема - смысл остаётся. Для случаев, где важен именно тон разговора (например, спорная ситуация с клиентом), стоит держать под рукой и саму аудиозапись, а не только текст. Обратная задача - превратить готовый текст обратно в живой голос - разобрана в гайде про ElevenLabs: пригодится, если из расшифровки нужно собрать уже озвученный материал
Насколько точно нейросети распознают русскую речь
Стопроцентной точности на русской речи не даёт ни один из трёх путей - в моём собственном прогоне Whisper тестовое слово распозналось верно, а в независимой проверке той же модели на другой записи одно слово программа услышала неправильно: «хастинга» вместо «хостинга»
Практический вывод одинаковый для всех трёх путей: для голосовых заметок, черновика конспекта или расшифровки встречи для себя текущего качества вполне достаточно. Для документа, который пойдёт куда-то официально - в договор, в протокол, в текст под подпись - готовый текст стоит перечитать глазами, а числа, имена и названия компаний проверить особенно внимательно
Что ещё может понадобиться рядом с расшифровкой
Расшифровка почти всегда - шаг перед чем-то другим, а не конечная точка сама по себе. Смотря что у тебя дальше по задаче:
- Готовый текст нужен как основа для сжатых тезисов или конспекта - нейросеть конспект: 4 шага от часа лекции до тезисов
- Записей и документов много, и текст нужно не только получить, но и складывать в один блокнот для вопросов - NotebookLM: источники в блокнот
- Запись - это видео, и текст нужен субтитрами прямо поверх картинки, а не отдельным файлом - нейросеть делает субтитры к видео: 3 сервиса
- Готов подключить Whisper прямо к помощнику и расшифровывать записи одной просьбой словами, без ручной загрузки на сайт - навык Whisper для Claude: 3 шага
- Нужен не текст, а разговор голосом с самим помощником, а не расшифровка своей записи - голосовой ИИ: 3 сервиса, где поговорить голосом
- Запись на другом языке, и нужен перевод на русский с озвучкой - нейросеть перевод видео: 5 шагов до русской озвучки
- Кроме расшифровки хочется закрыть и другие платные сервисы бесплатными аналогами - бесплатные замены платным сервисам: 8 штук
- Хочется разобраться в теме нейросетей и инструментов шире, чем одна задача расшифровки - раздел нейросети и инструменты
Источники
Все страницы открыты и проверены прямым запросом 3 сентября 2026 года; собственный прогон расшифровки снят на этой же машине в тот же день
- GitHub Whisper: официальный репозиторий - свободная лицензия MIT, описание модели, установка
- speech2text.ru - публичная страница сервиса, условия бесплатного пробного лимита
- Otter.ai: тарифы - официальные цифры бесплатного плана и плана Pro
- OpenAI: цены API - официальная цена распознавания речи за минуту
- Yandex Cloud: SpeechKit - официальная страница тарифов распознавания речи
Памятка: какой путь расшифровки выбрать
Шесть строк, которые закрывают выбор между тремя вариантами
Сохрани себе
- Одна короткая запись - подойдёт любой из трёх путей, разница в паре минут ожидания
- Архив в сотни часов - выгоднее локальный Whisper, лимита по количеству расшифровок у него нет
- Не хочется ничего ставить на компьютер - онлайн-сервис вроде speech2text.ru с бесплатным лимитом в часах
- Регулярные встречи с командой - подписка вроде Otter.ai со встроенной записью во время звонка
- Запись не должна покидать твой компьютер - решает только локальный Whisper по построению
- Ни один из трёх путей не даёт стопроцентной точности - официальный текст стоит перечитать глазами
Порог входа
Текст готов бесплатно, следующий шаг - тоже
Всё, что нужно для честного выбора между тремя путями расшифровки, ты только что прочитал бесплатно: как это работает, сколько стоит и на что смотреть при архиве записей. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоих же записей - тоже стоит ровно ноль
Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно
Частые вопросы
Чем расшифровать аудио в текст бесплатно?
Два бесплатных пути: Whisper локально на своём компьютере - без ограничения по количеству расшифровок, но требует один раз установить программу, и онлайн-сервис вроде speech2text.ru с пробным лимитом в 3 часа после регистрации - без установки, но лимит конечен
Какой вариант точнее распознаёт русскую речь?
Все три пути используют похожие по качеству модели, и ни один не даёт стопроцентной точности. В моём собственном прогоне Whisper тестовое слово распозналось верно, в независимой проверке той же модели на другой записи одно слово было услышано неправильно. Для заметок и черновика качества хватает всем трём, для официального документа текст стоит перечитывать
Нужен ли интернет для расшифровки через Whisper?
Только один раз, чтобы скачать саму программу и модель. Дальше расшифровка идёт на компьютере без подключения к сети, и запись физически не покидает диск - в отличие от онлайн-сервисов, где файл обязательно загружается на сервер
Сколько стоит расшифровка часа записи?
Локальный Whisper - бесплатно после установки, без ограничения по количеству часов. Онлайн-сервис с бесплатным лимитом - бесплатно в пределах пробных часов, дальше по тарифу. Платная подписка Otter.ai - входит в 16.99 доллара в месяц за 1200 минут на плане Pro. Поминутный API для разработчиков - от 0.18 до 0.36 доллара за час у разных моделей OpenAI
Что выбрать, если записей приходит много каждую неделю?
Регулярный архив меняет расчёт: то, что выглядело копеечным на одной записи, на сотне часов превращается в заметную сумму или упирается в месячный лимит бесплатного плана. При регулярном потоке локальный Whisper выигрывает по деньгам, а платная подписка - по удобству встроенной записи прямо во время звонка
Можно ли расшифровать запись на телефоне, без компьютера?
Да, через онлайн-сервис или приложение вроде Otter.ai - оба работают из браузера или мобильного приложения. Локальный путь через Whisper требует именно компьютера, на телефоне такую программу не ставят