Сколько токенов в странице текста и в PDF

По замеру на реальных файлах: русский текст расходует примерно 2,3 символа на токен, английский - 4,2. То есть одна страница по-русски весит около 800 токенов, а по-английски около 450. Полтысячи страниц PDF по-русски выходят за окно контекста в 200 тысяч токенов вдвое

Замер на реальных файлах

Общие оценки вида «токен это примерно четыре символа» верны для английского и заметно врут для русского. Проще замерить

Я взял два своих рабочих файла сопоставимого объёма и посчитал токенизатором cl100k_base

  1. Русский файл: 25 298 символов, 11 139 токенов. Выходит 2,27 символа на токен
  2. Английский файл: 30 430 символов, 7 169 токенов. Выходит 4,24 символа на токен

Вывод, который меняет расчёты. Один и тот же смысл по-русски обходится почти вдвое дороже по токенам, чем по-английски. Это не особенность конкретной модели, а следствие того, как устроены словари токенизаторов: кириллица дробится мельче. Отсюда и ощущение «Claude быстро ест токены», с которым приходят в поиск

Повторить замер можно самому:

python3 -c "import tiktoken;print(len(tiktoken.get_encoding('cl100k_base').encode(open('file.txt').read())))"

Как перевести это в страницы

Возьмём типовую страницу: примерно 1 800 знаков с пробелами

  1. Русская страница: около 800 токенов
  2. Английская страница: около 430 токенов
  3. Окно контекста стандартного варианта модели: 200 000 токенов, то есть примерно 250 русских страниц или 460 английских
  4. PDF на 560 страниц по-русски: около 450 000 токенов, вдвое больше окна

При превышении Claude сообщает об этом прямо, с точной цифрой перебора: «Context exceeds the 200k-token limit by 94k tokens». Это удобно тем, что не нужно гадать

Оценки приблизительные: точное число зависит от вёрстки, таблиц и того, сколько в тексте цифр и латиницы. Порядок величины они дают верный

Что делать с большими файлами

  1. Посмотреть, чем занято окно прямо сейчас:
    /context
  2. Сжать переписку, оставив суть:
    /compact
  3. Отключить неиспользуемые подключения, они тоже занимают место:
    /mcp disable <имя>

Про вариант с миллионом токенов. У части моделей есть расширенный контекст, он помечается суффиксом [1m] в списке моделей и включается отдельно через /usage-credits. Убрать такие варианты из выбора можно переменной CLAUDE_CODE_DISABLE_1M_CONTEXT=1. Расширенный контекст решает вопрос объёма, но не вопрос цены

Отдельный слой экономии - не тащить в контекст то, что уже разобрано: длинные файлы памяти и лишние подключения расходуют окно в каждой сессии. Как это устроено, разобрано в заметке про память

Три команды для разгрузки окна у тебя под рукой: /context, /compact, /mcp disable. Дальше встаёт вопрос, который эти команды решают только на один раз: как держать расход токенов низким по умолчанию, а не разгружать окно каждый раз вручную, когда оно уже забито

На Лагере ставим память и подключения так, чтобы контекст не раздувался с самого начала, а не лечим это командами по факту

Забрать путёвку в ИИ-Лагерь

Кнопка ведёт в мой закрытый канал. Жмёшь «Подать заявку», впускаю сразу, бот пишет в личку и отдаёт путёвку. Бесплатно

Частые вопросы

Сколько токенов в одной странице?

Около 800 для русского текста и около 430 для английского при расчёте на 1 800 знаков с пробелами. Разница берётся из замера: русский расходует примерно 2,27 символа на токен, английский 4,24

560 страниц PDF - это сколько токенов?

Порядка 450 тысяч токенов, если текст русский. Это вдвое больше окна в 200 тысяч токенов у стандартного варианта модели, поэтому такой документ придётся резать на части или обрабатывать по разделам

Почему Claude быстро ест токены на русском?

Потому что кириллица дробится токенизатором мельче латиницы. По моему замеру разница почти двукратная: 2,27 против 4,24 символа на токен. Один и тот же смысл по-русски обходится вдвое дороже

Связанные гайды

Больше материалов по теме - в разделе Claude Code: доступ, установка, оплата

Иван Сергеев, автор гайда: практик вайбкодинга и вайбмаркетинга, портрет в квадратном кадре

Иван Сергеев

Вайбмаркетинг и вайбкодинг для тех, кто начинает с нуля. Вырастил свою аудиторию до сотен тысяч подписчиков на контент-заводе на ИИ и помог 800 людям собрать больше 5 миллионов подписчиков

Источники

  • code.claude.com - точный текст сообщения о превышении окна, суффикс [1m] и переменная CLAUDE_CODE_DISABLE_1M_CONTEXT
  • github.com - токенизатор cl100k_base, которым сделан замер
  • Замеры 25 298 символов на 11 139 токенов и 30 430 на 7 169 сняты автором на своих файлах 9 августа 2026

На Лагере люди считают токены на своих собственных файлах, не на абстрактном примере, и сразу видят, где расход можно срезать

Забрать путёвку в ИИ-Лагерь

Это заявка в мой закрытый канал, не оплата. Впускаю сразу, дальше бот в личке отдаёт путёвку на три дня