Вайбкодинг · Claude
Не корми Claude PDF-ками
PDF, Word, Excel, презентации, картинки, аудио и даже ссылки YouTube можно превратить в чистый Markdown - родной язык языковых моделей. Тогда Claude читает содержание, а не мусор разметки, и не сжигает лимит. Делает это бесплатный опенсорс от Microsoft - MarkItDown. Лицензия MIT, 100% локально, без API-ключа: твои документы не уходят на сервер
Зачем это нужно
PDF заставляет Claude читать мусор
Таблицы и картинки внутри PDF сжигают токены, заставляют грузить файл заново в каждом чате и раздувают контекстное окно. Один PDF и пять вопросов почти наверняка съедят весь лимит
Markdown - родной формат для LLM. Он сохраняет заголовки, таблицы и списки, убирает визуальный мусор, по своей сути экономен по токенам и одинаково хорошо читается Claude, Gemini и GPT
Перед стартом
Проверь, что есть на машине
- ✓
Python 3.10 или выше
- ✓
pip работает из терминала
- ✓
(опционально) uv для более быстрой установки
- ✓
(опционально) ключ OpenAI, если нужны описания картинок
Python 3.9 и ниже не заведётся. Сначала проверь версию: python --version
Установка
Выбери свою систему
macOS
# Чистое виртуальное окружение python3 -m venv .venv source .venv/bin/activate # Установка со всеми конвертерами pip install 'markitdown[all]' # Проверка markitdown --help
Windows
python -m venv .venv .venv\Scripts\activate pip install "markitdown[all]" markitdown --help
Linux
python3 -m venv .venv source .venv/bin/activate pip install 'markitdown[all]' markitdown --help
Docker (без установки Python)
git clone https://github.com/microsoft/markitdown.git cd markitdown docker build -t markitdown:latest . docker run --rm -i markitdown:latest < your-file.pdf > output.md
Опция [all] тянет все конвертеры. Нужны только PDF - ставь pip install 'markitdown[pdf]', установка будет легче
Настройка по шагам
От терминала до чистого Markdown
- 01
Открой терминал
- 02
Перейди в папку для установки
cd ~/Documents/tools
- 03
Создай виртуальное окружение
python3 -m venv .venv
- 04
Активируй его
source .venv/bin/activate
- 05
Установи нужные конвертеры
pip install 'markitdown[all]'
- 06
Проверь на любом файле
markitdown ~/Downloads/test.pdf -o test.md
- 07
Открой результат и скопируй в Claude
PDF теперь чистый Markdown. Вставляй в Claude - контекстное окно остаётся маленьким
Команды
Шпаргалка
markitdown file.pdf
Печатает Markdown в терминал
markitdown file.pdf -o out.md
Сохраняет вывод в файл
cat file.pdf | markitdown
Подаёт ввод из stdin
markitdown --list-plugins
Показывает установленные плагины
markitdown --use-plugins file.pdf
Запускает с включёнными плагинами
markitdown file.pdf -d -e "<endpoint>"
Azure Document Intelligence для точных таблиц
Промпты к нему
Вставь промпт над готовым текстом
Универсальный промпт-анализатор: ставишь его перед текстом, который сконвертировал, и Claude выжимает суть
Ты - эксперт по анализу документов. Ниже [PDF / таблица / презентация / транскрипт], сконвертированный в Markdown. Сделай: 1. Дай саммари из 5 пунктов по ключевым мыслям 2. Вытащи каждое конкретное число, дату и имя 3. Назови один самый важный пункт-действие или инсайт 4. Отметь всё, что выглядит противоречиво или непонятно Ответ оформи в Markdown с понятными заголовками. Документ ниже: [вставь сюда сконвертированный Markdown]
Дневной воркфлоу
Одна команда, чистый вход, реальные ответы
Утро. Прислали 60-страничный договор PDF. Кидаешь его в терминал - через пару секунд чистый Markdown. Вставляешь в Claude с просьбой найти все пункты про автопродление, и получаешь ответ за один заход вместо трёх перезагрузок файла
День. Продажи прислали колоду со свежими ценами. Конвертируешь презентацию, скармливаешь Claude и просишь собрать три поста из ключевых слайдов. Готово за 30 секунд
Вечер. Нашёл 45-минутное интервью на YouTube. Конвертируешь ссылку в Markdown и просишь Claude вытащить 5 уроков для своего бизнеса. Смотреть не нужно
markitdown contract.pdf -o contract.md markitdown deck.pptx -o deck.md markitdown "https://youtu.be/abc123" -o interview.md
Приёмы
Чтобы работало быстрее
Ставь узкую сборку, когда можешь. pip install 'markitdown[pdf]' быстрее, чем [all], а результат тот же, если тебе нужны только PDF
Для сканов ставь OCR-плагин. На картиночных PDF базовый MarkItDown вернёт пустоту - нужен markitdown-ocr и ключ OpenAI, чтобы вытащить текст из встроенных изображений
Сцепляй с другими утилитами. На Mac markitdown file.pdf | pbcopy сразу кладёт вывод в буфер обмена, готовый к вставке в любой чат
Для чувствительных документов отключай LLM-функции. Описание картинок и транскрипция YouTube ходят во внешние API. Нужна чисто локальная конвертация - не передавай llm_client
Пакетная обработка через ZIP. Кинь 50 файлов в архив и запусти MarkItDown один раз - он пройдёт по всем и склеит вывод
Если что-то не так
Частые ошибки и фиксы
command not found: markitdown
Не активировано окружение. Запусти source .venv/bin/activate (Mac/Linux) или .venv\Scripts\activate (Windows)
ModuleNotFoundError: pdfminer
Поставил базовый пакет без зависимостей. Запусти pip install 'markitdown[pdf]' или [all]
Пустой вывод из скана
PDF картиночный. Поставь OCR: pip install markitdown-ocr и pip install openai, передай LLM-клиент
Python 3.9 не поддерживается
Нужен Python 3.10+. Поставь новее через pyenv install 3.12 или используй Docker-образ
Таблицы кривые
Сложные таблицы лучше тянет Azure Document Intelligence. Запусти с -d -e "<endpoint>"
Быстрый справочник
Всё в одном блоке
# Установка python3 -m venv .venv source .venv/bin/activate pip install 'markitdown[all]' # Конвертировать любой файл markitdown file.pdf -o output.md # Из stdin cat file.pdf | markitdown > output.md # YouTube в Markdown markitdown "https://youtu.be/xyz" -o transcript.md # Список плагинов markitdown --list-plugins
Что дальше
MarkItDown ты поставил, документы читаются в Markdown без потери токенов
Так бывает у многих: ставят одну тулу, радуются экономии токенов, и на этом всё останавливается на долгие месяцы. Инструмент есть, а системы вокруг него так и не выросло
На ИИ-Лагере вокруг Claude собираем весь конвейер: документы, контент, автоматизация выходят потоком, а не одной тулой за раз
Забрать путёвку в ИИ-ЛагерьКнопка ведёт в мой закрытый канал. Жмёшь «Подать заявку», впускаю сразу, бот пишет в личку и отдаёт путёвку. Бесплатно
Ещё по теме
Нейросети и ИИ-инструменты
Claude и PDF: как скормить документы без лишних токенов
Claude и PDF: как отдавать документы без лишних токенов - конвертация в чистый текст по шагам
РЕПО: 5 репозиториев GitHub, чтобы выучить код с нуля до работы
Репозитории GitHub для новичка: 30-Days-Of-Python, ML-For-Beginners, Build-your-own-X, Project-based-learning и 90-Day-Cybersecurity. Что…
7 открытых репозиториев на GitHub, по которым учат ИИ бесплатно - Иван Сергеев
7 реальных открытых репозиториев на GitHub, по которым учат ИИ внутри топовых команд: nanoGPT, курс Hugging Face, Anthropic Cookbook, DSPy,…
Я каждый день сам прохожу этот процесс у себя: документы, контент, автоматизация, и на Лагере показываю его вживую, без сухой методички
Три дня, бесплатно, войти можно сегодня
Забрать путёвку в ИИ-ЛагерьЭто заявка в мой закрытый канал, не оплата. Впускаю сразу, дальше бот в личке отдаёт путёвку на три дня
Сохрани себе
Памятка по шагам
- ✓ pip работает из терминала
- ✓ (опционально) uv для более быстрой установки
- ✓ (опционально) ключ OpenAI, если нужны описания картинок
- 02 Перейди в папку для установки cd ~/Documents/tools
- 03 Создай виртуальное окружение python3 -m venv .venv
- 04 Активируй его source .venv/bin/activate
- 05 Установи нужные конвертеры pip install 'markitdown[all]'
- 06 Проверь на любом файле markitdown ~/Downloads/test.pdf -o test.md
Куда идти дальше
Следующий шаг
Python 3.9 и ниже не заведётся. Сначала проверь версию: python --version