Что такое токены в Claude и как они работают? Мы посчитали 3,8 миллиарда
Токен это кусочек слова, и Claude считает их четырёх видов: вход, запись в кэш, чтение из кэша и выход. Мы посчитали 30 дней собственных сессий Claude Code, 3,8 миллиарда токенов: 98% составил разговор, перечитанный из кэша, 0,3% то, что написал Claude. Сколько стоит каждый вид, почему сессия тяжелеет с каждым ходом и что измеряет 5-часовое окно.
Это слово встречается вокруг Claude повсюду: в прайс-листе, в сообщении о лимите, в /usage, в каждой статье про экономию. Почти никто не объясняет, что такое токен, а число, на которое смотрят люди, редко оказывается тем, что важно. То, что Claude пишет в ответ, составляет долю процента от того, что насчитывает сессия программирования.
Поэтому мы посчитали свои. Тридцать дней сессий Claude Code на одном Mac, с 10 сентября по 9 октября 2026 года: 388 сессий, 19 668 запросов к модели, 3,8 миллиарда токенов. Вот что такое токен, четыре способа, которыми Claude их считает, и как эти числа выглядят на реальной работе.
Токен это кусочек текста, и размер кусочка меняется
Модель не читает ни буквы, ни слова. Она читает токены: кусочки текста из фиксированного словаря, иногда целое короткое слово, часто часть слова, иногда один символ или байт для того, чего она никогда не видела. Всё считается в этих кусочках: то, что ты отправляешь, то, что пишет Claude, то, что он хранит между ходами.
Сколько текста помещается в токен, зависит от модели и от языка. Глоссарий Anthropic называет примерно 3,5 английского символа на токен для моделей до Claude 4.7 и говорит, что Claude 4.7 и более новые используют новый токенизатор, который даёт примерно на 30% больше токенов на тот же текст. Точное число даёт только эндпоинт подсчёта токенов, с той моделью, которую ты собираешься использовать.
Мы измерили соотношение на собственном тексте. Наши агенты отвечают по-французски, поэтому мы взяли ответы, состоящие только из текста, без рассуждений, без вызова инструмента, без блока кода, не короче 80 слов: 296 ответов от Opus 5, Opus 5.5, Fable 5.1 и Sonnet 5.5. Медиана: 2,3 символа на токен, примерно 2,6 токена на слово. Код, JSON и нелатинские письменности дают другие соотношения. Смысл не в точной цифре: токен меньше слова, и вручную их никогда не считают.
Каждый запрос учитывается на четырёх счётчиках
Claude Code записывает каждую сессию в JSONL-транскрипт в ~/.claude/projects/. Каждый ответ модели несёт блок usage. Вот настоящий, из наших транскриптов, с оставленными полезными полями:
"usage": {
"input_tokens": 2,
"cache_creation_input_tokens": 51836,
"cache_read_input_tokens": 24882,
"output_tokens": 315,
"output_tokens_details": { "thinking_tokens": 54 },
"cache_creation": {
"ephemeral_1h_input_tokens": 51836,
"ephemeral_5m_input_tokens": 0
}
}
Четыре счётчика, и стоят они по-разному:
input_tokens: часть промпта, которая не записывается в кэш и не читается из него, оплачивается по базовой цене входа. В Claude Code это почти всегда горстка токенов, потому что почти всё идёт через кэш.cache_creation_input_tokens: часть промпта, сохранённая в кэше, чтобы следующий запрос мог её переиспользовать. Запись в кэш стоит 1,25 цены входа для 5-минутного кэша и 2 цены для часового. В наших транскриптах 97% записей были часовыми.cache_read_input_tokens: часть промпта, воспроизведённая из кэша. Чтение из кэша стоит 0,1 цены входа на большинстве моделей, 0,05 на Opus 5.5 и Sonnet 5.5 и 0,025 на Fable 5.1 (страница Anthropic о кэшировании промптов, проверено 10 октября 2026 года).output_tokens: то, что пишет Claude, включая рассуждения. Выход стоит в 5 раз дороже входа на всех текущих моделях: 20 долларов за миллион на Opus 5.5, 25 на Opus 5, 50 на Fable 5.1, 10 на Sonnet 5.5.
Первые три в сумме дают контекст, который модель прочитала для этого запроса. Четвёртый это ответ.
Как выглядят 30 дней наших сессий
По 19 668 запросам, каждый посчитан один раз (один вызов API может занимать несколько строк транскрипта):
| Счётчик | Токены | Доля токенов | Доля стоимости по публичным ценам API |
|---|---|---|---|
| Вход (без кэша) | 114 411 | 0,003% | 0,04% |
| Записи в кэш | 74 834 070 | 2,0% | 37,4% |
| Чтения из кэша | 3 710 054 709 | 97,7% | 45,7% |
| Выход | 12 727 193 | 0,34% | 16,8% |
| Итого | 3 797 730 383 | 100% | 2 563 доллара |
Столбец стоимости оценивает каждый запрос по его собственной модели и его собственной длительности кэша. Мы не платим эту сумму: эти сессии шли по подписке. Это вес каждого счётчика, то же взвешивание, которое AgentsRoom использует, чтобы распределить процент плана между проектами.
Три вывода.
Почти каждый токен это перечитанный разговор. 97,7% токенов приходится на чтения из кэша. 99,2% запросов что-то читают из кэша. Когда говорят, что сессия «израсходовала 50 миллионов токенов», смотрят именно на это.
То, что пишет Claude, крошечно в токенах и совсем не крошечно в деньгах. 0,34% токенов, 16,8% счёта, потому что выход это самый дорогой токен из всех. Рассуждения составили 29% этого выхода.
Записи в кэш оказываются дорогим сюрпризом. 2% токенов, 37% стоимости. Мы ожидали, что они возникают из-за истечения кэша, но только 16 запросам из 19 668 пришлось заново записать холодный контекст, семь из них после больше чем часа тишины. 79% записей это просто каждое новое сообщение и каждый результат инструмента, сохранённые один раз по двойной цене входа, прежде чем их перечитывают на каждом следующем ходе. Остальные 20% приходятся на первый запрос каждой сессии.
Почему сессия тяжелеет с каждым ходом
Модель ничего не хранит между двумя запросами. Claude Code каждый раз отправляет всё заново: системный промпт, определения инструментов, CLAUDE.md, каждое сообщение, каждый прочитанный файл, каждый вывод команды. Кэш делает повторяющуюся часть дешёвой в пересчёте на токен, но не бесплатной и не меньшей.
Медианный контекст, прочитанный за запрос, по позиции в сессии:
| Запрос в сессии | Запросы | Медианный контекст |
|---|---|---|
| 1-й | 388 | 52 000 токенов |
| С 2-го по 10-й | 3 210 | 93 000 токенов |
| С 11-го по 50-й | 8 546 | 161 000 токенов |
| С 51-го по 200-й | 6 414 | 237 000 токенов |
| После 200-го | 1 110 | 342 000 токенов |
Медианный запрос читал 179 000 токенов контекста, чтобы написать 290 токенов ответа. В этом соотношении вся история токенов в агенте для программирования: ответ короткий, чтение длинное, и чтение растёт вместе с сессией.
Наш первый запрос тяжёлый, 52 000 токенов ещё до того, как кто-то что-либо набрал, потому что наши агенты стартуют с длинным описанием роли и четырьмя MCP-серверами, чьи определения инструментов лежат в промпте. Голая сессия Claude Code в пустой папке стартует намного ниже. /context показывает, что несёт твоя сессия до первого сообщения.
Сколько тратит одна сессия
По 380 сессиям минимум из трёх запросов:
- 33 запроса в медиане, от 16 до 61 для средней половины.
- 27 000 выходных токенов в медиане, от 12 000 до 48 000.
- 5,4 миллиона обработанных токенов в медиане, от 1,5 до 10,7 миллиона для средней половины, из них 5,1 миллиона чтений из кэша.
- 181 000 токенов, записанных в кэш или отправленных без кэша, в медиане: та часть, которая действительно была новой.
- 4,55 доллара по публичным ценам API в медиане, от 1,81 до 9,25 для средней половины.
Так что честный ответ на вопрос «сколько токенов тратит сессия программирования» звучит так: диапазон примерно от одного до десяти миллионов, почти целиком один и тот же контекст, прочитанный заново. Сессия, которая всю вторую половину дня работает над одной длинной задачей, находится в верхней части диапазона; сессия, которая исправляет один баг и останавливается, в нижней.
Что на самом деле считают 5-часовое окно и неделя
На плане Pro или Max ты никогда не видишь баланса токенов. Справочный центр Anthropic говорит, что у обоих планов есть пятичасовой лимит сессии и недельный лимит, что эти лимиты общие для Claude и Claude Code (включая IDE) и что у планов Max есть отдельный недельный лимит для Fable. Ни для одного из них он не публикует цифру в токенах. /usage показывает процент каждого окна и время, когда оно сбросится.
Что сдвигает этот процент, по собственному списку Anthropic: длина сообщения, размер вложений, длина текущего разговора, использование инструментов, выбор модели, уровень усилий и многошаговые задачи. Если читать вместе с таблицами выше, в сессии программирования доминирует именно «длина текущего разговора»: контекст, читаемый на каждом запросе, растёт с 52 000 до 237 000 токенов за пятьдесят запросов. Справочный центр также говорит, что кэшированное содержимое в проектах меньше расходует твои лимиты при повторном использовании, и это та же идея, что и цена чтения из кэша.
Мы не знаем, как Anthropic переводит токены в процент окна, и не будем выдумывать пересчёт. Зато данные говорят, что поздний запрос в длинной сессии учитывается в несколько раз больше, чем ранний, за тот же вопрос.
Что меняет счёт на практике
Четыре рычага, в порядке их веса на наших данных:
/clearмежду не связанными задачами. Anthropic называет его «самым эффективным рычагом и для качества, и для стоимости». Новая задача в старой сессии на каждом запросе оплачивает контекст старой задачи./compact, когда продолжаешь длинную сессию. Он заменяет историю коротким резюме, поэтому следующие запросы читают меньше.- Следи за тем, что попадает в контекст. Чтение файла или вывод команды на 20 000 токенов записывается один раз по двойной цене входа, а потом перечитывается на каждом следующем запросе до конца сессии. Читать нужные строки вместо всего файла выгодно дважды.
- Модель и уровень усилий. Рассуждения составили 29% нашего выхода, а выход это самый дорогой токен. Более низкий уровень усилий на рутинной работе снижает выход, а более дешёвая модель снижает сразу все цены.
Что не сыграло роли на наших данных: оставлять сессию простаивать. С часовым кэшем, который Claude Code использует в наших транскриптах, холодная перезапись случилась 16 раз за 30 дней.
Другие способы тратить меньше описаны в статье как сократить расходы на токены Claude Code.
Посчитай свои
Таблица выше получена скриптом без зависимостей. Он читает все транскрипты Claude Code на машине, считает каждый запрос один раз и выводит четыре счётчика и медианы по сессиям. Добавь фильтр по o["timestamp"], если нужен временной интервал.
import json, glob, os, statistics as st
from collections import defaultdict
FIELDS = ("input_tokens", "cache_creation_input_tokens",
"cache_read_input_tokens", "output_tokens")
totals, sessions = defaultdict(int), []
for path in glob.glob(os.path.expanduser("~/.claude/projects/*/*.jsonl")):
seen, session = set(), defaultdict(int)
with open(path, errors="ignore") as fh:
for line in fh:
try: o = json.loads(line)
except ValueError: continue
msg = o.get("message") or {}
usage = msg.get("usage") if isinstance(msg, dict) else None
if o.get("type") != "assistant" or not usage: continue
rid = o.get("requestId") or o.get("uuid")
if rid in seen: continue # one API call can span several lines
seen.add(rid)
session["requests"] += 1
for f in FIELDS:
n = usage.get(f) or 0
totals[f] += n
session[f] += n
if session["requests"] >= 3: sessions.append(session)
grand = sum(totals[f] for f in FIELDS)
for f in FIELDS:
print(f"{f:30s} {totals[f]:>15,} {100 * totals[f] / grand:6.2f}%")
for key in ("requests", "output_tokens", "cache_read_input_tokens"):
print(f"median per session, {key}: {st.median(s[key] for s in sessions):,.0f}")
Сравни свои доли с нашими. Строка чтений из кэша это перечитанный разговор, а строка записей в кэш это то, что было новым: эти две строки говорят о твоём счёте больше, чем строка выхода.
Где это показывает AgentsRoom
Скрипт даёт тебе месяц. Пока ты работаешь, AgentsRoom показывает те же счётчики для каждого агента: значок токенов в поле ввода каждой сессии, который становится красным, когда сессия тяжелеет, монитор сессии со входом, выходом, записями в кэш, чтениями из кэша и долей попаданий в кэш, и трассировку сессии, которая воспроизводит сессию ход за ходом и показывает, какое чтение файла или какой результат инструмента заполнил контекст. Панель использования распределяет процент, который сообщает твой план, между твоими проектами и агентами, взвешивая каждую сессию по тому, сколько она стоила бы по ценам API, тем же взвешиванием, что и в таблице выше.
Чего ничто из этого не даёт, так это баланса токенов, потому что у твоего плана его нет. Об этом читай статью сколько токенов у тебя осталось в Claude. О скорости, с которой приходят эти выходные токены, читай токены в секунду в Claude Code, измеренные.
Частые вопросы
Что такое токен в Claude?
Единица, в которой Claude читает и пишет текст: кусочек слова, иногда целое короткое слово, иногда один символ или байт. Anthropic уточняет, что размер зависит от модели и языка: на моделях до Claude 4.7 токен был примерно 3,5 английского символа, а Claude 4.7 и более новые используют новый токенизатор, который даёт примерно на 30% больше токенов на тот же текст. Всё, что делает Claude, измеряется в токенах: то, что ты отправляешь, то, что он пишет в ответ, и то, что он хранит в кэше между ходами.
Сколько символов или слов в одном токене Claude?
Зависит от языка и от текста. Anthropic называет примерно 3,5 английского символа на токен для моделей до Claude 4.7 и примерно на 30% больше токенов на тот же текст для Claude 4.7 и более новых. На 296 чисто текстовых ответах, которые наши агенты написали по-французски в сентябре и октябре 2026 года, токен составлял 2,3 символа, то есть примерно 2,6 токена на слово. Код, JSON и нелатинские письменности дают другие соотношения. Для точного подсчёта эндпоинт подсчёта токенов Anthropic принимает текст и модель.
Почему Claude Code тратит так много токенов?
Потому что каждый запрос заново отправляет весь разговор: системный промпт, определения инструментов, CLAUDE.md, каждое сообщение и каждый результат инструмента с самого начала. На наших 19 668 запросах медианный запрос нёс 179 000 токенов контекста, чтобы написать 290 токенов ответа, а контекст рос с 52 000 токенов на первом запросе сессии до 237 000 после пятидесяти запросов. Кэш делает это перечитывание дешёвым в пересчёте на токен, но оно всё равно учитывается.
Сколько токенов тратит типичная сессия Claude Code?
На наших 380 сессиях из трёх запросов и больше, записанных с 10 сентября по 9 октября 2026 года: в медиане 33 запроса, 27 000 выходных токенов и 5,4 миллиона обработанных токенов в сумме, из них 5,1 миллиона чтений из кэша. Половина сессий укладывалась в диапазон от 1,5 до 10,7 миллиона токенов. По публичным ценам API такая медианная сессия стоила бы примерно 4,55 доллара; на плане Pro или Max та же работа вместо этого списывается с 5-часового и недельного окон.
Учитываются ли токены рассуждений?
Да. Токены рассуждений входят в output_tokens в каждом блоке usage, а поле thinking_tokens показывает, какая часть выхода была рассуждениями. В API они оплачиваются по цене выхода, и Anthropic называет уровень усилий среди того, что быстрее расходует лимиты плана. В нашем корпусе рассуждения составили 29% всего, что написали модели.
Чем токены записи в кэш отличаются от токенов чтения из кэша?
Запись в кэш сохраняет часть промпта, чтобы следующий запрос мог её переиспользовать, и стоит дороже обычного входа: 1,25 цены входа для 5-минутного кэша, 2 цены для часового кэша. Чтение из кэша переиспользует эту сохранённую часть и стоит намного дешевле: 0,1 цены входа на большинстве моделей, 0,05 на Opus 5.5 и Sonnet 5.5, 0,025 на Fable 5.1. В наших сессиях чтения из кэша составили 98% токенов и 46% стоимости по публичным ценам; записи в кэш 2% токенов и 37% стоимости.
Скачать AgentsRoom
Запускай всех своих ИИ-агентов во всех проектах из одного окна.
Приложение-компаньон: следите за агентами на ходу
Используйте Claude, Codex, Antigravity CLI или другого поставщика AI.
Отправляйте баги и запросы прямо в ваш публичный бэклог.
Читать далее
Как сохранить работу Claude Code после разрыва SSH: рецепт с tmux
Сохраните работу Claude Code после разрыва SSH с помощью tmux. Вернитесь к тому же процессу, проверьте постоянство сессии и включите опцию AgentsRoom.
Читать статьюRoutines в Claude Code: что работает в облаке, что остаётся на вашей машине и как выбрать
Routines позволяют Claude Code запускать сохранённый промпт без вашего участия: по расписанию, по вызову API или по событию GitHub, в облачной сессии на свежем клоне вашего репозитория. Они находятся в research preview. У Claude Code есть и два локальных способа планировать работу, запланированные задачи десктопного приложения и /loop, и все три ведут себя по-разному: минимальный интервал, доступ к вашим локальным файлам, запросы разрешений, что происходит, когда ноутбук спит. Это руководство раскладывает все три варианта с ограничениями из документации, а затем объясняет, почему наши собственные семь ночных агентов работают на локальной машине.
Читать статьюСемь ИИ-агентов работают у нас по ночам: агенты по расписанию не только для кода, с промптами
Пользователь спросил, как мы используем ИИ-агентов для чего-то, кроме написания кода. С 28 августа каждый вечер на Mac mini запускаются семь агентов по расписанию: дежурный CEO, SEO-команда, продакт-менеджер, фиксер багов, команда соцсетей, хранитель документации и репортёр, который присылает сводку из 25 строк. 33 ночи, 31 утреннее письмо, 51 исправленный баг со ссылкой на коммит, 7 статей в блоге на 20 языках. Что делает каждый, как они передают друг другу работу, не разговаривая, какая модель выполняет какую работу, четыре правила, которые пришлось выучить их промптам, и сами промпты, готовые к копированию.
Читать статью