qvib.pro
EN

~10 мин чтения · всем · Обновлено: 28.07.2026

Куда уходят токены Claude Code и как их беречь

Куда уходят токены Claude Code и как их экономить

Коротко

Лимит кончается к обеду не потому, что вы много написали, а потому что при каждом ответе модели заново отправляется весь диалог целиком: системный промпт, CLAUDE.md, все прочитанные файлы и весь вывод команд. Ваши буквы в этом объёме — доли процента. Платите вы за историю, которую таскаете за собой.

Спасает от этого кэш: повторно отправленный кусок читается по цене 0,1 от обычного входного токена. Но кэш ломается от вещей, которые кажутся бесплатными, — смены модели через /model, смены уровня усилий, включения fast mode, /compact, обновления Claude Code. Каждая такая операция заставляет один запрос перечитать весь диалог по полной цене.

Отсюда практика: выбрать модель в начале сессии и не трогать, чистить контекст через /clear между задачами (он бесплатный, в отличие от /compact), держать CLAUDE.md коротким, шумные операции отдавать сабагентам. Ниже — разбор по статьям расхода, способ замерить свой расход и девять приёмов, которые дают эффект.

Почему счётчик растёт, когда вы ничего не делаете

Модель не помнит предыдущий запрос. Каждый раз, когда вы отправляете сообщение или агент вызывает инструмент, Claude Code пересылает весь контекст заново: системный промпт, определения инструментов, файл проекта, каждое сообщение, каждый результат grep и npm test. Один вызов инструмента — один такой запрос. Задача, где агент прочитал десять файлов и трижды прогнал тесты, — это не один запрос, а полтора десятка, и каждый следующий тяжелее предыдущего. Однострочный вопрос в сессии, открытой с утра, всё равно тянет на себя весь разговор.

Второй источник роста — фоновая работа. Суммаризация для claude --resume и проверки статуса стоят меньше $0,04 за сессию, в бюджете не видно. А вот запланированная задача, которая срабатывает по таймеру в открытой сессии, шлёт полный контекст каждый раз — это уже заметно.

Куда уходят токены: разбор по статьям

Цифры ниже — из официальной документации Anthropic, а не из чужих замеров. Каждую можно проверить по ссылке.

Статья расхода Сколько Что с этим делать
Вся история диалога в каждом запросе зависит от сессии; читается по цене кэша — 0,1x от входного токена /clear между задачами
Промах мимо кэша после паузы один запрос по полной цене входа; TTL — час на подписке, 5 минут на API-ключе не уходить надолго из активной задачи
Прочитанная веб-страница 10 КБ ~2 500 токенов max_content_tokens в API
Страница документации 100 КБ ~25 000 токенов сабагент вместо чтения в основном контексте
PDF статьи 500 КБ ~125 000 токенов конвертировать и грепать локально
Определения инструментов (Opus 5, tool_choice: auto) 286 токенов + 325 на bash + 700 на редактор отключить неиспользуемые MCP-серверы
Веб-поиск на API $10 за 1 000 поисков сверх токенов web fetch, в отличие от него, бесплатен
Команда агентов (agent teams) ~7x от обычной сессии в plan mode держать команду маленькой, гасить участников
Extended thinking десятки тысяч выходных токенов за запрос по умолчанию /effort или MAX_THINKING_TOKENS=8000

Деталь, которую почти нигде не пишут: у моделей Claude 4.7 и новее новый токенизатор, дающий примерно на 30% больше токенов на том же тексте. Один и тот же файл на Opus 5 «весит» дороже, чем на Sonnet 4.6, — при сравнении цен по прайсу это надо держать в голове.

Что ломает кэш, а что нет

Кэш-чтение стоит 0,1 от входного токена, запись на 5 минут — 1,25x, на час — 2x (прайс Anthropic). Разница между «кэш держится» и «кэш сломался» — десятикратная, и ломается он от безобидных на вид действий.

Действие Кэш Комментарий
/model посреди задачи ломается полностью у каждой модели свой кэш
/effort, смена уровня усилий ломается полностью Claude Code спросит подтверждение
Включение fast mode ломается один раз за диалог дешевле включать в начале сессии
/compact ломается слой диалога сам по себе стоит денег: читает то, что суммирует
Обновление Claude Code ломается особенно больно при --resume длинной сессии
Подключение MCP-сервера зависит при отложенной загрузке инструментов (по умолчанию) — не ломается
/clear сброс стоит ноль
/rewind сохраняется откат к уже закэшированному префиксу
Правка CLAUDE.md посреди сессии сохраняется и не применяется до /clear или перезапуска
Вызов скилла или команды сохраняется дописывается как сообщение
Запуск сабагента сохраняется у родителя у сабагента свой кэш и TTL 5 минут даже на подписке

Две строки здесь особенно полезны. Первая: /rewind дешевле /compact — откат к предыдущей точке возвращается в уже прогретый кэш, а компакт строит новый префикс с нуля. Вторая: правка CLAUDE.md в середине сессии не применяется. Люди правят файл, удивляются, что агент ведёт себя по-старому, и правят ещё раз — а надо было сделать /clear.

Как замерить свой расход, а не чужой

Чужие цифры — про чужой проект. Свои снимаются за минуту:

  1. /context — что именно сейчас занимает окно. Здесь видно раздутый CLAUDE.md и лишние MCP-серверы.
  2. /usage — расход за 24 часа или 7 дней (клавиши d и w). На платных планах разбивает его по скиллам, сабагентам, плагинам и MCP-серверам и помечает поведения, съевшие 10% и больше.
  3. Statusline-скрипт, читающий current_usage: поля cache_creation_input_tokens и cache_read_input_tokens. Высокое отношение чтения к записи — кэш работает. Если запись остаётся высокой запрос за запросом, что-то в префиксе меняется.

Честное ограничение: /usage считает по локальной истории этой машины, не видит другие устройства и claude.ai, а доллары в блоке Session посчитаны локально по прайс-листу и на подписке к вашему счёту отношения не имеют.

Ориентир из документации: в корпоративных внедрениях средний расход — около $13 на разработчика в активный день и $150–250 в месяц. Это про API-развёртывания, а не про подписку Pro, и как бенчмарк для одиночки не годится.

Девять приёмов, которые дают эффект

  1. /clear между несвязанными задачами. Стоит ноль, срезает весь мусор. Перед этим /rename, чтобы потом найти сессию через /resume.
  2. Не трогайте модель и уровень усилий внутри задачи. Переключение «на Haiku, чтобы сэкономить» посреди длинной сессии обходится дороже, чем экономит.
  3. CLAUDE.md до 200 строк — рекомендация из документации. Всё специфическое — в скиллы: они грузятся по вызову, а CLAUDE.md висит в контексте всегда.
  4. Снизьте extended thinking там, где он не нужен. /effort, отключение в /config или MAX_THINKING_TOKENS=8000 для моделей с фиксированным бюджетом. Токены размышления тарифицируются как выходные — самые дорогие.
  5. Шумные операции — сабагентам. Прогон тестов, чтение логов, поход в документацию: вывод остаётся в контексте сабагента, в основной диалог возвращается сводка.
  6. CLI вместо MCP, где есть выбор. gh, aws, gcloud не добавляют в контекст ни одного определения инструмента. Неиспользуемые серверы отключить через /mcp.
  7. Хук, фильтрующий вывод до модели. PreToolUse на Bash, оставляющий от лога только строки с ERROR, превращает десятки тысяч токенов в сотни. Готовый скрипт есть в документации по расходам.
  8. Plan mode перед крупной задачей. Shift+Tab, агент сначала предлагает подход. Дороже на шаг — дешевле, чем переделывать реализацию, ушедшую не туда.
  9. Конкретные промпты. «Добавь валидацию в функцию login в auth.ts» вместо «улучши валидацию в проекте»: второе запускает сканирование всего репозитория.

Разбор отдельных приёмов с командами — в карточке арсенала про экономию токенов.

Что экономить бессмысленно

  • Просить модель «отвечать короче». Выходные токены дороже входных, но их в разы меньше, чем контекста. Экономия на уровне погрешности.
  • Сокращать свои сообщения. Ваш текст — доли процента запроса. Пишите подробно: это дешевле второго захода.
  • Отключать кэш. Переменные DISABLE_PROMPT_CACHING* существуют для отладки. В обычной работе это удорожание в десять раз.
  • Компактить по любому поводу. /compact читает то, что суммирует. Нужен чистый лист — /clear, он бесплатный.
  • Гнаться за дешёвой моделью на сложной задаче. Три итерации Haiku по цене $1/$5 за миллион легко перекрывают одну итерацию Sonnet.

Российский контекст: главная ловушка

Россия не входит в список стран, где Anthropic продаёт доступ, поэтому Pro за $20 или Max от $100 (прайс на июль 2026) оформляется не напрямую. Многие идут через сторонние шлюзы с подменой ANTHROPIC_BASE_URL.

Здесь и прячется ловушка. По документации, при запросах через LLM-шлюз или кастомный ANTHROPIC_BASE_URL кэш живёт там, куда шлюз пересылает запросы, и работает ли он вообще — зависит от шлюза. Если шлюз отклоняет cache breakpoint, Claude Code повторяет запрос без него и оставляет блок некэшированным до конца разговора.

Практический вывод: на посреднике вы можете платить полную входную цену за весь диалог на каждом запросе — вдесятеро больше, чем на прямом доступе, при тех же действиях. Проверяется за минуту: посмотрите cache_read_input_tokens в statusline. Если там стабильный ноль — кэш у вас не работает, и никакие приёмы из списка выше этого не исправят. Сравнение вариантов оплаты — в разборе тарифов и способов оплаты Claude Code и цен и лимитов API.

Как поддерживать это в актуальном виде

Прайс меняется: Sonnet 5 стоит $2/$10 за миллион только до 31 августа 2026 года, дальше — $3/$15. Раз в квартал перечитывайте страницу цен и свой CLAUDE.md — файл разрастается до 400 строк, и каждую вы оплачиваете в каждой сессии. Реальные счета — в разборе сколько стоит месяц ИИ-разработки.

Частые вопросы

Почему лимит кончился, хотя я задал два вопроса?

Скорее всего, сессия была открыта давно и в ней накопился большой контекст, либо вы вернулись после перерыва длиннее часа и первый запрос прошёл мимо кэша. На подписке Claude Code запрашивает кэш с TTL в один час; после перерыва дольше — полное перечитывание истории по обычной цене входа. /usage пометит это как cache miss, если промахи заняли больше 10% расхода.

Сколько запросов в миллионе токенов?

Прямого перевода нет: запрос не является единицей тарификации. Один запрос агента стоит от нескольких сотен токенов до сотен тысяч, если в контексте лежит большой репозиторий. Ориентир Anthropic: 1 токен ≈ 4 символа или 0,75 слова английского текста; на русском токенов на тот же текст заметно больше.

/compact или /clear — что дешевле?

/clear стоит ноль и стирает всё. /compact отправляет отдельный запрос с полной историей и инструкцией суммировать. Пока кэш тёплый, он читается из кэша и обходится недорого. А /compact на возобновлённой старой сессии — самый дорогой сценарий: кэша нет, история перечитывается целиком по полной цене.

Правда ли, что команда агентов расходует в 7 раз больше?

Такая оценка есть в документации Claude Code: agent teams расходуют примерно в 7 раз больше токенов, чем обычная сессия, когда участники работают в plan mode — у каждого своё окно контекста и свой процесс. По умолчанию функция выключена и включается переменной CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1.

Читайте также

Базовый разбор темы — Claude Code: с него удобно начать, если тема новая.