Вайбкодинг · Расход токенов
Headroom: как срезать счёт за нейросети почти на 95%, не трогая код
Каждый раз, когда Claude или другой ИИ-агент решает задачу по коду, он перечитывает кучу всего: логи, дерево файлов, вывод инструментов, историю диалога. Половина этого просто шум, но ты платишь за него полную цену токенами. Есть бесплатный открытый инструмент Headroom, который встаёт между твоим агентом и моделью и ужимает этот мусор до того, как он дойдёт до нейросети. Счёт падает на 70-95 процентов, а ответ ты получаешь тот же самый. Ставится в две команды. Ниже разберём по шагам.
С чего всё начинается
Почему счёт за токены растёт, хотя ты делаешь то же самое
Когда ты работаешь в Claude Code, модель на каждом шаге заново читает контекст: что лежит в файлах, что вернули команды, что вы обсуждали пять сообщений назад. Чем дольше сессия, тем тяжелее этот ком. И большая часть в нём повторяется, модель уже это видела, но ты снова платишь за то, чтобы протащить это через неё.
На длинной задаче по отладке такая сессия легко раздувается до шестидесяти тысяч токенов и больше. Ты не писал лишнего, просто агент таскает за собой весь хвост. А токены это деньги: либо твоя оплата по API, либо съеденный дневной лимит подписки.
Корень не в том, что ты много просишь. Корень в том, что в модель уходит гора шума, который можно ужать без потери смысла. Этим и занимается Headroom.
Что это за инструмент
Слой сжатия между твоим агентом и моделью
Headroom это маленькая открытая программа, которая встаёт рядом с Claude Code и работает как фильтр на входе в модель. Всё, что агент собирается отправить нейросети, сначала проходит через Headroom: он определяет, что тут шум, и ужимает его, сохраняя смысл. Оригинал при этом остаётся у тебя на компьютере, и если модели вдруг понадобится полная версия, она её запросит.
Сделал инструмент инженер Tejas Chopra, код открытый и бесплатный. Работает локально, у тебя на машине, никакой регистрации и отдельного аккаунта не нужно. Есть приятный бонус, режим Headroom Learn: он копается в твоих прошлых сессиях, находит ошибки, которые агент повторял раз за разом, и сам вписывает исправления в твой файл настроек CLAUDE.md, чтобы он перестал наступать на те же грабли.
chopratejas / headroom
Открытый слой сжатия контекста для Claude Code и других агентов. Бесплатный, лицензия Apache 2.0, работает локально. Твои данные и ключи остаются на твоём компьютере.
github.com/chopratejas/headroom →Шаг за шагом
Как поставить, по шагам
Шаг 0. Поставь сам Claude Code
Headroom цепляется к Claude Code, и команды ниже ты будешь вставлять в его терминал. Если Claude Code ещё не стоит, сначала поставь его по отдельному гайду, это минут десять и без программирования:
Гайд: как установить Claude Code →
Шаг 1. Проверь, что есть Python
Headroom написан на Python, нужна версия 3.10 или новее. У большинства она уже стоит вместе с Claude Code. Если не уверен, прямо скажи Claude Code словами: «проверь, какая у меня версия Python, и если старая, поставь свежую». Он разберётся сам.
Шаг 2. Установи Headroom одной командой
Вставь в терминал Claude Code эту строку и нажми ввод. Она скачает и поставит инструмент со всеми возможностями:
pip install "headroom-ai[all]"
Шаг 3. Подключи Headroom к Claude Code
Ещё одна команда, и всё. Она сама пропишет связку в настройки, и Claude Code начнёт ходить к модели через Headroom:
headroom wrap claude
После этого перезапусти Claude Code, чтобы он подхватил новый слой. Дальше работаешь как обычно, ничего в своих привычках менять не надо, сжатие идёт незаметно в фоне.
Шаг 4. Посмотри, сколько сэкономил
Поработал немного и хочешь увидеть цифры, сколько токенов ушло до сжатия и после. Одна команда:
headroom perf
Шаг 5. Включи режим, который чинит ошибки агента
Это тот самый Headroom Learn. Он смотрит твои прошлые сессии, находит, где агент повторял одни и те же промахи, и записывает поправки в твой файл CLAUDE.md. Сначала запусти в режиме просмотра, без изменений:
headroom learn --verbosity
Посмотрел, что он предлагает, согласен, применяешь той же командой с добавкой:
headroom learn --verbosity --apply
Что это даёт в цифрах
Тот же ответ, в разы дешевле
Вот реальные замеры из материалов инструмента, не из рекламы. Сессия отладки инцидента: было 65 тысяч токенов, стало 5 тысяч. Это минус 92 процента, а ответ тот же самый.
Поиск по коду на сотню результатов: было почти 18 тысяч токенов, стало полторы тысячи. Разбор задачи на гитхабе: минус 73 процента. В среднем экономия гуляет в диапазоне от 70 до 95 процентов в зависимости от задачи.
Работает это не магией, а аккуратностью: Headroom выравнивает повторяющиеся куски так, чтобы модель брала их из своего кэша со скидкой, и жмёт только то, что реально шум, оставляя смысл нетронутым.
Что дальше
Headroom стоит, счёт за токены упал в разы, а смысл ответов не пострадал
Headroom срезает шум в переписке с моделью. В самом проекте шум остаётся: непонятно, на ком зарабатывать и что продавать, а дешёвые токены этот шум не глушат
На ИИ-Лагере беру сэкономленные токены и веду дальше: ставлю вокруг Claude Code рабочий стек, который превращает дешёвые ответы в готовый продукт
Забрать путёвку в ИИ-ЛагерьЗаявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно
Частые вопросы
Бесплатен ли Headroom и не станут ли ответы хуже после сжатия?
Это правда бесплатно?
Да, инструмент открытый и бесплатный, лицензия Apache 2.0, можно использовать в работе. Отдельного аккаунта и своего ключа Headroom не нужно, он работает поверх твоего обычного Claude Code.
Это безопасно?
Код открытый, виден целиком. Headroom работает локально на твоём компьютере, твои данные и ключи никуда не уходят, а оригинал сжатого всегда лежит рядом у тебя.
Нужно ли уметь программировать?
Нет. Ты копируешь две команды и вставляешь в Claude Code. Если что-то не встало, прямо словами говоришь ему «не получилось вот тут, почини», и он разбирается.
А ответы не станут хуже?
Идея в том, чтобы убирать только шум, а смысл оставлять. Если модели вдруг нужна полная версия куска, она его запросит, оригинал лежит локально. Хочешь убедиться, посмотри замеры командой из Шага 4.
Сохрани себе
Памятка по шагам
- Почему счёт за токены растёт, хотя ты делаешь то же самое
- Слой сжатия между твоим агентом и моделью
- Тот же ответ, в разы дешевле
- Headroom стоит, счёт за токены упал в разы, а смысл ответов не пострадал
- Бесплатен ли Headroom и не станут ли ответы хуже после сжатия?
Куда идти дальше
Следующий шаг
Идея в том, чтобы убирать только шум, а смысл оставлять. Если модели вдруг нужна полная версия куска, она его запросит, оригинал лежит локально. Хочешь убедиться, посмотри замеры командой из Шага 4.
Вопросы
Частые вопросы
Бесплатен ли Headroom и не станут ли ответы хуже после сжатия?
Да, инструмент открытый и бесплатный, лицензия Apache 2.0, можно использовать в работе. Отдельного аккаунта и своего ключа Headroom не нужно, он работает поверх твоего обычного Claude Code.