Расшифровка аудио · сентябрь 2026

Чем расшифровать аудио в текст: 3 способа для русской речи в 2026

Расшифровать аудио в текст можно тремя честными способами: бесплатно и локально через Whisper, бесплатно с лимитом через онлайн-сервис вроде speech2text.ru, или платно по минутам через сервис вроде Otter.ai. Я прогнал свою запись через Whisper на Маке и 3 сентября 2026 года снял тарифы у обоих онлайн-вариантов

Ниже - что выбрать под свою задачу и что честно неидеально в каждом варианте. Если запись - это видео, а результат нужен субтитрами поверх картинки, а не отдельным текстовым файлом, это другая задача - она разобрана в гайде нейросеть делает субтитры к видео

К концу статьи ты будешь знать: чем локальная расшифровка отличается от онлайн-сервиса на практике, сколько стоит расшифровка часа записи в каждом из трёх вариантов, и на что обращать внимание, если записей у тебя не одна, а архив за месяцы

Посчитай две вещи прежде чем выбирать: сколько минут записи набегает у тебя за месяц и должна ли запись остаться только на твоём компьютере. Меньше 300 минут и конфиденциальность не критична - хватит бесплатного онлайн-лимита. Больше или запись приватная - ставь Whisper локально, он бесплатен без ограничения по объёму

Какая у тебя запись и что с ней дальше

Голосовое на минуту и архив из двухсот часов старых созвонов - разные задачи, даже если инструмент один и тот же. Перед выбором стоит понять две вещи про свою запись: сколько она длится и что будет с текстом дальше

Если запись одна и короткая - подойдёт любой из трёх путей, разница будет в паре минут ожидания. Если записей много и они копятся регулярно - каждая минута платного сервиса складывается в заметную сумму, и локальный вариант начинает выигрывать по деньгам уже на первом же месяце архива

Готовый текст обычно нужен не сам по себе, а для следующего шага: конспект лекции, тезисы встречи, черновик статьи. Если тебе именно это и нужно после расшифровки - соседний гайд нейросеть конспект: от часа лекции до тезисов забирает эстафету ровно там, где заканчивается эта статья

Путь 1. Whisper локально: бесплатно навсегда, без интернета после установки

Whisper - это открытая модель распознавания речи от OpenAI, которую можно поставить на свой компьютер и пользоваться ею без единого платежа. По официальной странице репозитория, код и веса модели «released under the MIT License» - и программа, и обученная модель отданы под свободной лицензией, платить за скачивание не нужно никому. Это одна из локальных нейросетей, которые работают прямо на твоём железе - тот же принцип, что у Ollama для текстовых моделей, только для звука

Официальная страница GitHub Whisper: открытая модель распознавания речи под лицензией MIT
Официальная страница github.com/openai/whisper, снята 03.09.2026

Разница с онлайн-сервисом не в качестве, а в том, где живёт твоя запись. У сервиса файл загружается к нему на сервер и ждёт очереди. У Whisper запись остаётся на твоём диске, а расшифровка идёт прямо на процессоре компьютера - интернет нужен только один раз, чтобы скачать саму программу

Что сравниваемОнлайн-сервисWhisper локально
Куда попадает записьзагружается на сервер сервисаостаётся на твоём компьютере
Сколько стоитпо подписке или по минутамбесплатно после установки
Нужен ли интернетда, всё время работытолько один раз, чтобы скачать
Ограничениетарифом или лимитом минутсвободным местом на диске

Таблица прокручивается вбок →

Свой прогон: как это выглядит на практике

Я взял короткую тестовую запись голоса и прогнал её через Whisper на своём Маке 3 сентября 2026 года. Результат:

Мой прогон 03.09.2026: расшифровка записи 17.1 секунды

  • Длина записи 17.1 секунды, обычная короткая фраза
  • Время расшифровки 932.63 миллисекунды - меньше секунды на весь текст
  • Точность текст распознан верно, включая тестовое слово «хостинг»
  • Интернет во время расшифровки не использовался - модель уже стояла на диске

Расшифровка вышла точной на этой записи, но идеальной модель не бывает никогда. У соседней проверки той же модели на другой записи слово «хостинга» распозналось как «хастинга» - для голосовых заметок и конспекта такая мелочь не критична, а для официального документа текст всё равно стоит перечитать глазами перед тем, как отправлять дальше

Что это даёт: расшифровка перестаёт быть услугой, за которую платят каждый месяц, и становится обычной программой на компьютере, как проигрыватель музыки. Если хочется не просто попробовать один раз, а поставить Whisper себе и подключить его к помощнику вроде Claude Code, чтобы он расшифровывал записи по одной просьбе словами - весь путь установки, шаг за шагом, с готовыми командами для копирования, разобран в отдельном гайде навык Whisper для Claude: 3 шага к расшифровке речи. Здесь я эту установку не повторяю: там - подробная инструкция для тех, кто готов один раз настроить у себя, тут - честное сравнение, какой путь вообще выбрать. Самого помощника, если он ещё не стоит, разбирает гайд по установке Claude Code из России, а порядок работы с ним фиксирует файл CLAUDE.md

Путь 2. Онлайн-сервис с бесплатным лимитом: без установки, но с потолком

speech2text.ru - один из готовых сайтов, где запись загружается через браузер и текст приходит через несколько минут, без установки программы на компьютер

Публичная страница speech2text.ru: расшифровка аудио онлайн, бесплатный пробный лимит
Официальная страница speech2text.ru, снята 03.09.2026

По официальной странице сервиса, после регистрации даётся «бесплатные 3 часа транскрибации», а до регистрации можно посмотреть демонстрацию расшифровки бесплатно и без входа в аккаунт. Три часа - это заметный запас для разовой задачи: конспект одной лекции, расшифровка одного созвона, один архив голосовых за неделю

Три шага, если выбираешь этот путь:

  1. Зайди на сайт сервиса и зарегистрируйся. Обычно достаточно почты - это открывает бесплатный лимит в часах
  2. Загрузи файл записи через браузер. Кнопка загрузки на сайте принимает обычные форматы звука - m4a, mp3, wav
  3. Дождись готового текста. Время ожидания зависит от длины записи и загрузки сервиса в момент отправки - минуты, не секунды, как у локального Whisper

Что это даёт: не нужно ничего ставить на компьютер, работает из браузера на любом устройстве, включая телефон. Обратная сторона - лимит конечен, и когда бесплатные часы кончатся, дальше уже по тарифу сервиса, а конкретные цены после бесплатного лимита на публичной странице явно не расписаны - их стоит уточнять прямо перед тем, как лимит подойдёт к концу

Продолжение темы у меня разобрано отдельно: 4 задачи, где помощник экономит часы в 2026

Путь 3. Платная подписка по минутам: удобство встреч и командной работы

Otter.ai - готовое приложение для регулярных встреч, где расшифровка идёт не разовой загрузкой файла, а встроена прямо в процесс звонка

Официальная страница тарифов Otter.ai: бесплатный план 300 минут в месяц и Pro за 16.99 доллара
Официальная страница тарифов otter.ai/pricing, снята 03.09.2026

По официальной странице тарифов, бесплатный план даёт «300 monthly transcription minutes» и «3 lifetime audio/video file imports» - триста минут расшифровки в месяц и всего три загрузки готовых файлов за всё время существования аккаунта. Платный план Pro стоит 16.99 доллара в месяц и включает «1200 in-app recording minutes» и «10 monthly audio/video file imports» - в четыре раза больше минут и заметно больше загрузок

План Otter.aiМинут расшифровки в месяцЗагрузок готовых файловЦена
Бесплатный3003 за всё время аккаунта0
Pro120010 в месяц16.99 доллара/мес

Таблица прокручивается вбок →

Что это даёт: удобство встроенной записи прямо во время звонка, без отдельного шага «сохранить файл и куда-то его загрузить». Обратная сторона - это подписка, и она рассчитана на регулярную работу командой, а не на разовую расшифровку одной старой записи. Оплата зарубежной подписки из России - отдельный вопрос, он разобран в общем виде в гайде нужна ли иностранная карта для сервисов вроде Claude: логика оплаты у большинства зарубежных подписок похожая

Во сколько выходит расшифровка часа записи в трёх вариантах

Чтобы сравнение было честным, а не просто «одно бесплатно, другое платно», стоит прикинуть цену на конкретном объёме - один час записи:

ПутьЧас записи стоитЧто при этом происходит с файлом
Whisper локально0 рублей после установкиостаётся на твоём компьютере
speech2text.ru, в пределах бесплатных 3 часов0 рублейзагружается на сервер сервиса
Otter.ai, бесплатный план (в пределах 300 мин/мес)0 рублейзагружается на сервер сервиса
Otter.ai, план Proвходит в 16.99 доллара/мес за 1200 минутзагружается на сервер сервиса

Таблица прокручивается вбок →

Для разработчиков: API по минутам и более точные зарубежные модели

Есть и вариант для тех, кто готов подключать расшифровку через код, а не через готовую кнопку на сайте: сервисы вроде OpenAI или Яндекс SpeechKit продают распознавание речи как отдельную услугу для разработчиков, по цене за минуту записи. У OpenAI это 0.006 доллара за минуту у полной модели Whisper и 0.003 доллара у более лёгкой gpt-4o-mini-transcribe - то есть 0.36 и 0.18 доллара за час записи соответственно (цены сняты с официальной страницы platform.openai.com, независимо подтверждённая соседней статьёй про Whisper 30.08.2026). У Яндекс SpeechKit цена начинается от 10 рублей за минуту распознавания, с бесплатным пробным периодом на месяц для нового аккаунта. Оба варианта - это не готовое приложение с кнопкой «загрузи файл», а инструмент для тех, кто сам пишет код или нанимает того, кто напишет

Есть и более точные модели распознавания у зарубежных нейросетей вроде Gemini или GPT, но доступ к ним из России обычно требует VPN и карту иностранного банка - для честной задачи «загрузил файл и получил текст без лишних препятствий» три пути этой статьи проще и доступнее

Смежная часть работы разобрана в гайде Mac mini на M6 в 2026 году: цена в рублях, 4 варианта

На что смотреть, если записей не одна, а архив

Двести часов старых голосовых по цене поминутного API вышли бы в 72 доллара и загрузку каждого файла постороннему сервису - разница между тремя путями сильнее всего видна именно на архиве, а не на одной короткой записи. У локального Whisper та же работа - это один вечер работы компьютера и ноль рублей, потому что лимита по количеству расшифровок у бесплатной программы попросту нет. Такой же принцип «поставил один раз - пользуешься бесплатно» работает и для других задач: подборка похожих находок собрана в гайде Claude Code бесплатно: находки вместо платного софта

Если записи приходят регулярно, а не разовым архивом - три вещи стоит проверить у себя, прежде чем выбирать путь:

Три вопроса перед выбором инструмента для регулярной расшифровки

  • Сколько минут в месяц набегает меньше 300 - хватит бесплатного плана онлайн-сервиса, больше - выгоднее локальный вариант или платная подписка
  • Важна ли конфиденциальность записи если запись не должна покидать твой компьютер - только локальный Whisper решает это по построению
  • Нужна ли встроенная запись во время звонка если да - готовое приложение вроде Otter.ai удобнее, чем отдельный шаг «сохранить файл и загрузить»

Регулярный поток файлов - это ровно тот случай, где помощнику стоит один раз объяснить порядок действий и дальше не повторять его руками. Про то, как записать такой порядок в отдельный навык помощника, который срабатывает сам по просьбе словами - отдельный разбор, не про расшифровку конкретно, а про устройство навыков целиком

Какие форматы записи принимает каждый путь

Три пути этой статьи работают с одними и теми же форматами звука - голосовое из мессенджера (m4a, ogg), запись с диктофона (wav), файл с телефона (mp3). Разница не в том, ЧТО они принимают, а в том, КАК файл туда попадает

У Whisper локально файл просто указывается программе - он читает звук напрямую с диска, поддержка форматов идёт через вторую программу для звука, которая устанавливается рядом. У онлайн-сервисов файл загружается через кнопку в браузере, форматы принимаются те же, просто путь до расшифровки короче на один шаг - открыл страницу, перетащил файл, дождался

Отдельный случай - звук из видео. Все три пути умеют вытащить звуковую дорожку и расшифровать именно её, отдельно превращать видео в аудио перед загрузкой не требуется - об этом заранее заботится сам сервис или программа. Если видео нужно ещё и порезать по смыслу, а не только расшифровать - соседний разбор Claude и монтаж видео: нарезка записи показывает, как это делать словами, без программы монтажа

Запись с несколькими голосами: интервью, созвон, встреча

Простая расшифровка превращает запись с двумя и больше говорящими в сплошной текст без разделения, кто что сказал - подходит для конспекта общего смысла, но не годится, если важно понять реплики по отдельности

Разделение голосов по говорящим называется диаризацией, и не все три пути умеют её одинаково. Готовые приложения вроде Otter.ai, заточенные под встречи, обычно размечают реплики по спикерам прямо во время звонка - это часть их основной задачи. У локального Whisper в базовой команде такой разметки нет, она добавляется отдельным дополнительным шагом поверх обычной расшифровки

Что это тебе даёт при выборе: если задача - разово понять содержание разговора, подойдёт любой путь. Если важно точно знать, кто из участников что сказал - удобнее готовое приложение для встреч, где разделение голосов идёт из коробки

Telegram и мессенджеры: расшифровка прямо в переписке

Telegram Premium даёт четвёртый вариант расшифровки - встроенную функцию прямо внутри мессенджера, без отдельного файла и отдельного сайта. Результат появляется прямо под голосовым сообщением одной кнопкой

Кроме встроенной функции существуют сторонние боты с похожей задачей и бесплатным дневным лимитом - они работают отдельно от официального Premium и не входят в основное сравнение этой статьи, потому что качество и надёжность стороннего бота я лично не проверял

Этот путь удобен для одного конкретного случая: голосовое от коллеги или друга, которое проще прочитать, чем прослушать в шумном месте. Для регулярной рабочей расшифровки записей на компьютере три пути выше подходят лучше

Что теряется при переводе речи в текст

Готовый текст - не полная копия звука, а его упрощённая версия даже у самой точной модели. Три вещи теряются почти всегда, и это стоит знать заранее, а не удивляться потом:

Что не переносится в текст при любой расшифровке

  • Интонация и эмоция текст не показывает, было ли сказано серьёзно или с иронией - это решается только прослушиванием оригинала
  • Паузы и запинки большинство расшифровок сглаживают живую речь в читаемый текст, убирая «э-э» и обрывы фразы
  • Кто именно говорит без явного разделения без диаризации несколько голосов сливаются в один сплошной текст

Для рабочих заметок и конспекта это не проблема - смысл остаётся. Для случаев, где важен именно тон разговора (например, спорная ситуация с клиентом), стоит держать под рукой и саму аудиозапись, а не только текст. Обратная задача - превратить готовый текст обратно в живой голос - разобрана в гайде про ElevenLabs: пригодится, если из расшифровки нужно собрать уже озвученный материал

Насколько точно нейросети распознают русскую речь

Стопроцентной точности на русской речи не даёт ни один из трёх путей - в моём собственном прогоне Whisper тестовое слово распозналось верно, а в независимой проверке той же модели на другой записи одно слово программа услышала неправильно: «хастинга» вместо «хостинга»

Практический вывод одинаковый для всех трёх путей: для голосовых заметок, черновика конспекта или расшифровки встречи для себя текущего качества вполне достаточно. Для документа, который пойдёт куда-то официально - в договор, в протокол, в текст под подпись - готовый текст стоит перечитать глазами, а числа, имена и названия компаний проверить особенно внимательно

Что ещё может понадобиться рядом с расшифровкой

Расшифровка почти всегда - шаг перед чем-то другим, а не конечная точка сама по себе. Смотря что у тебя дальше по задаче:

Источники

Все страницы открыты и проверены прямым запросом 3 сентября 2026 года; собственный прогон расшифровки снят на этой же машине в тот же день

Памятка: какой путь расшифровки выбрать

Шесть строк, которые закрывают выбор между тремя вариантами

Сохрани себе

  • Одна короткая запись - подойдёт любой из трёх путей, разница в паре минут ожидания
  • Архив в сотни часов - выгоднее локальный Whisper, лимита по количеству расшифровок у него нет
  • Не хочется ничего ставить на компьютер - онлайн-сервис вроде speech2text.ru с бесплатным лимитом в часах
  • Регулярные встречи с командой - подписка вроде Otter.ai со встроенной записью во время звонка
  • Запись не должна покидать твой компьютер - решает только локальный Whisper по построению
  • Ни один из трёх путей не даёт стопроцентной точности - официальный текст стоит перечитать глазами

Порог входа

Текст готов бесплатно, следующий шаг - тоже

Всё, что нужно для честного выбора между тремя путями расшифровки, ты только что прочитал бесплатно: как это работает, сколько стоит и на что смотреть при архиве записей. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоих же записей - тоже стоит ровно ноль

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

Чем расшифровать аудио в текст бесплатно?

Два бесплатных пути: Whisper локально на своём компьютере - без ограничения по количеству расшифровок, но требует один раз установить программу, и онлайн-сервис вроде speech2text.ru с пробным лимитом в 3 часа после регистрации - без установки, но лимит конечен

Какой вариант точнее распознаёт русскую речь?

Все три пути используют похожие по качеству модели, и ни один не даёт стопроцентной точности. В моём собственном прогоне Whisper тестовое слово распозналось верно, в независимой проверке той же модели на другой записи одно слово было услышано неправильно. Для заметок и черновика качества хватает всем трём, для официального документа текст стоит перечитывать

Нужен ли интернет для расшифровки через Whisper?

Только один раз, чтобы скачать саму программу и модель. Дальше расшифровка идёт на компьютере без подключения к сети, и запись физически не покидает диск - в отличие от онлайн-сервисов, где файл обязательно загружается на сервер

Сколько стоит расшифровка часа записи?

Локальный Whisper - бесплатно после установки, без ограничения по количеству часов. Онлайн-сервис с бесплатным лимитом - бесплатно в пределах пробных часов, дальше по тарифу. Платная подписка Otter.ai - входит в 16.99 доллара в месяц за 1200 минут на плане Pro. Поминутный API для разработчиков - от 0.18 до 0.36 доллара за час у разных моделей OpenAI

Что выбрать, если записей приходит много каждую неделю?

Регулярный архив меняет расчёт: то, что выглядело копеечным на одной записи, на сотне часов превращается в заметную сумму или упирается в месячный лимит бесплатного плана. При регулярном потоке локальный Whisper выигрывает по деньгам, а платная подписка - по удобству встроенной записи прямо во время звонка

Можно ли расшифровать запись на телефоне, без компьютера?

Да, через онлайн-сервис или приложение вроде Otter.ai - оба работают из браузера или мобильного приложения. Локальный путь через Whisper требует именно компьютера, на телефоне такую программу не ставят