Що таке токени в Claude і як вони працюють? Ми порахували 3,8 мільярда
Токен це шматочок слова, і Claude рахує їх чотирьох видів: вхід, запис у кеш, читання з кешу і вихід. Ми порахували 30 днів власних сесій Claude Code, 3,8 мільярда токенів: 98% становила розмова, перечитана з кешу, 0,3% те, що написав Claude. Скільки коштує кожен вид, чому сесія важчає з кожним ходом і що вимірює 5-годинне вікно.
Це слово трапляється навколо Claude всюди: у прайс-листі, у повідомленні про ліміт, у /usage, у кожній статті про економію. Майже ніхто не пояснює, що таке токен, а число, на яке дивляться люди, рідко виявляється тим, що важливе. Те, що Claude пише у відповідь, становить частку відсотка від того, що нараховує сесія програмування.
Тож ми порахували свої. Тридцять днів сесій Claude Code на одному Mac, з 10 вересня по 9 жовтня 2026 року: 388 сесій, 19 668 запитів до моделі, 3,8 мільярда токенів. Ось що таке токен, чотири способи, якими Claude їх рахує, і як ці числа виглядають на реальній роботі.
Токен це шматочок тексту, і розмір шматочка змінюється
Модель не читає ні літер, ні слів. Вона читає токени: шматочки тексту з фіксованого словника, іноді ціле коротке слово, часто частину слова, іноді один символ або байт для того, чого вона ніколи не бачила. Усе рахується в цих шматочках: те, що ти надсилаєш, те, що пише Claude, те, що він зберігає між ходами.
Скільки тексту вміщується в токен, залежить від моделі та від мови. Глосарій Anthropic називає приблизно 3,5 англійського символу на токен для моделей до Claude 4.7 і каже, що Claude 4.7 і новіші використовують новий токенізатор, який дає приблизно на 30% більше токенів на той самий текст. Точне число дає лише ендпоінт підрахунку токенів, з тією моделлю, яку ти збираєшся використовувати.
Ми виміряли співвідношення на власному тексті. Наші агенти відповідають французькою, тож ми взяли відповіді, що складаються лише з тексту, без міркування, без виклику інструмента, без блоку коду, щонайменше з 80 слів: 296 відповідей від Opus 5, Opus 5.5, Fable 5.1 і Sonnet 5.5. Медіана: 2,3 символу на токен, приблизно 2,6 токена на слово. Код, JSON і нелатинські писемності дають інші співвідношення. Суть не в точній цифрі: токен менший за слово, і вручну їх ніколи не рахують.
Кожен запит враховується на чотирьох лічильниках
Claude Code записує кожну сесію в JSONL-транскрипт у ~/.claude/projects/. Кожна відповідь моделі має блок usage. Ось справжній, із наших транскриптів, із залишеними корисними полями:
"usage": {
"input_tokens": 2,
"cache_creation_input_tokens": 51836,
"cache_read_input_tokens": 24882,
"output_tokens": 315,
"output_tokens_details": { "thinking_tokens": 54 },
"cache_creation": {
"ephemeral_1h_input_tokens": 51836,
"ephemeral_5m_input_tokens": 0
}
}
Чотири лічильники, і коштують вони по-різному:
input_tokens: частина промпту, яка не записується в кеш і не читається з нього, оплачується за базовою ціною входу. У Claude Code це майже завжди жменька токенів, бо майже все йде через кеш.cache_creation_input_tokens: частина промпту, збережена в кеші, щоб наступний запит міг її повторно використати. Запис у кеш коштує 1,25 ціни входу для 5-хвилинного кешу і 2 ціни для годинного. У наших транскриптах 97% записів були годинними.cache_read_input_tokens: частина промпту, відтворена з кешу. Читання з кешу коштує 0,1 ціни входу на більшості моделей, 0,05 на Opus 5.5 і Sonnet 5.5 і 0,025 на Fable 5.1 (сторінка Anthropic про кешування промптів, перевірено 10 жовтня 2026 року).output_tokens: те, що пише Claude, разом із міркуванням. Вихід коштує в 5 разів дорожче за вхід на всіх поточних моделях: 20 доларів за мільйон на Opus 5.5, 25 на Opus 5, 50 на Fable 5.1, 10 на Sonnet 5.5.
Перші три в сумі дають контекст, який модель прочитала для цього запиту. Четвертий це відповідь.
Як виглядають 30 днів наших сесій
За 19 668 запитами, кожен порахований один раз (один виклик API може займати кілька рядків транскрипту):
| Лічильник | Токени | Частка токенів | Частка вартості за публічними цінами API |
|---|---|---|---|
| Вхід (без кешу) | 114 411 | 0,003% | 0,04% |
| Записи в кеш | 74 834 070 | 2,0% | 37,4% |
| Читання з кешу | 3 710 054 709 | 97,7% | 45,7% |
| Вихід | 12 727 193 | 0,34% | 16,8% |
| Разом | 3 797 730 383 | 100% | 2 563 долари |
Стовпець вартості оцінює кожен запит за його власною моделлю і його власною тривалістю кешу. Ми не платимо цю суму: ці сесії йшли за підпискою. Це вага кожного лічильника, те саме зважування, яке AgentsRoom використовує, щоб розподілити відсоток плану між проєктами.
Три висновки.
Майже кожен токен це перечитана розмова. 97,7% токенів припадає на читання з кешу. 99,2% запитів щось читають із кешу. Коли кажуть, що сесія «витратила 50 мільйонів токенів», дивляться саме на це.
Те, що пише Claude, крихітне в токенах і зовсім не крихітне в грошах. 0,34% токенів, 16,8% рахунку, бо вихід це найдорожчий токен з усіх. Міркування становило 29% цього виходу.
Записи в кеш виявляються дорогим сюрпризом. 2% токенів, 37% вартості. Ми очікували, що вони виникають через спливання кешу, але лише 16 запитам із 19 668 довелося заново записати холодний контекст, сімом із них після понад години тиші. 79% записів це просто кожне нове повідомлення і кожен результат інструмента, збережені один раз за подвійною ціною входу, перш ніж їх перечитують на кожному наступному ході. Решта 20% припадає на перший запит кожної сесії.
Чому сесія важчає з кожним ходом
Модель нічого не зберігає між двома запитами. Claude Code щоразу надсилає все заново: системний промпт, визначення інструментів, CLAUDE.md, кожне повідомлення, кожен прочитаний файл, кожен вивід команди. Кеш робить повторювану частину дешевою в перерахунку на токен, але не безкоштовною і не меншою.
Медіанний контекст, прочитаний за запит, за позицією в сесії:
| Запит у сесії | Запити | Медіанний контекст |
|---|---|---|
| 1-й | 388 | 52 000 токенів |
| З 2-го по 10-й | 3 210 | 93 000 токенів |
| З 11-го по 50-й | 8 546 | 161 000 токенів |
| З 51-го по 200-й | 6 414 | 237 000 токенів |
| Після 200-го | 1 110 | 342 000 токенів |
Медіанний запит читав 179 000 токенів контексту, щоб написати 290 токенів відповіді. У цьому співвідношенні вся історія токенів в агенті для програмування: відповідь коротка, читання довге, і читання зростає разом із сесією.
Наш перший запит важкий, 52 000 токенів ще до того, як хтось щось набрав, бо наші агенти стартують із довгим описом ролі та чотирма MCP-серверами, чиї визначення інструментів лежать у промпті. Гола сесія Claude Code в порожній теці стартує набагато нижче. /context показує, що несе твоя сесія до першого повідомлення.
Скільки витрачає одна сесія
За 380 сесіями щонайменше з трьох запитів:
- 33 запити в медіані, від 16 до 61 для середньої половини.
- 27 000 вихідних токенів у медіані, від 12 000 до 48 000.
- 5,4 мільйона оброблених токенів у медіані, від 1,5 до 10,7 мільйона для середньої половини, з них 5,1 мільйона читань із кешу.
- 181 000 токенів, записаних у кеш або надісланих без кешу, в медіані: та частина, яка справді була новою.
- 4,55 долара за публічними цінами API в медіані, від 1,81 до 9,25 для середньої половини.
Отже, чесна відповідь на запитання «скільки токенів витрачає сесія програмування» така: діапазон приблизно від одного до десяти мільйонів, майже повністю той самий контекст, прочитаний заново. Сесія, яка всю другу половину дня працює над одним довгим завданням, перебуває у верхній частині діапазону; сесія, яка виправляє один баг і зупиняється, у нижній.
Що насправді рахують 5-годинне вікно і тиждень
На плані Pro або Max ти ніколи не бачиш балансу токенів. Довідковий центр Anthropic каже, що обидва плани мають п'ятигодинний ліміт сесії та тижневий ліміт, що ці ліміти спільні для Claude і Claude Code (включно з IDE) і що плани Max мають окремий тижневий ліміт для Fable. Для жодного з них він не публікує цифру в токенах. /usage показує відсоток кожного вікна і час, коли воно поновиться.
Що зсуває цей відсоток, за власним списком Anthropic: довжина повідомлення, розмір вкладень, довжина поточної розмови, використання інструментів, вибір моделі, рівень зусиль і багатокрокові завдання. Якщо читати разом із таблицями вище, у сесії програмування домінує саме «довжина поточної розмови»: контекст, що читається на кожному запиті, зростає з 52 000 до 237 000 токенів за п'ятдесят запитів. Довідковий центр також каже, що кешований вміст у проєктах менше витрачає твої ліміти під час повторного використання, і це та сама ідея, що й ціна читання з кешу.
Ми не знаємо, як Anthropic переводить токени у відсоток вікна, і не вигадуватимемо перерахунок. Натомість дані кажуть, що пізній запит у довгій сесії враховується в кілька разів більше, ніж ранній, за те саме запитання.
Що змінює рахунок на практиці
Чотири важелі, у порядку їхньої ваги на наших даних:
/clearміж не пов'язаними завданнями. Anthropic називає його «найефективнішим важелем і для якості, і для вартості». Нове завдання в старій сесії на кожному запиті оплачує контекст старого завдання./compact, коли продовжуєш довгу сесію. Він замінює історію коротким підсумком, тож наступні запити читають менше.- Стеж за тим, що потрапляє в контекст. Читання файлу або вивід команди на 20 000 токенів записується один раз за подвійною ціною входу, а потім перечитується на кожному наступному запиті до кінця сесії. Читати потрібні рядки замість усього файлу вигідно двічі.
- Модель і рівень зусиль. Міркування становило 29% нашого виходу, а вихід це найдорожчий токен. Нижчий рівень зусиль на рутинній роботі зменшує вихід, а дешевша модель знижує одразу всі ціни.
Що не відіграло ролі на наших даних: залишати сесію без діла. З годинним кешем, який Claude Code використовує в наших транскриптах, холодний перезапис стався 16 разів за 30 днів.
Інші способи витрачати менше описано в статті як зменшити витрати на токени Claude Code.
Порахуй свої
Таблиця вище отримана скриптом без залежностей. Він читає всі транскрипти Claude Code на машині, рахує кожен запит один раз і виводить чотири лічильники та медіани за сесіями. Додай фільтр за o["timestamp"], якщо потрібен часовий проміжок.
import json, glob, os, statistics as st
from collections import defaultdict
FIELDS = ("input_tokens", "cache_creation_input_tokens",
"cache_read_input_tokens", "output_tokens")
totals, sessions = defaultdict(int), []
for path in glob.glob(os.path.expanduser("~/.claude/projects/*/*.jsonl")):
seen, session = set(), defaultdict(int)
with open(path, errors="ignore") as fh:
for line in fh:
try: o = json.loads(line)
except ValueError: continue
msg = o.get("message") or {}
usage = msg.get("usage") if isinstance(msg, dict) else None
if o.get("type") != "assistant" or not usage: continue
rid = o.get("requestId") or o.get("uuid")
if rid in seen: continue # one API call can span several lines
seen.add(rid)
session["requests"] += 1
for f in FIELDS:
n = usage.get(f) or 0
totals[f] += n
session[f] += n
if session["requests"] >= 3: sessions.append(session)
grand = sum(totals[f] for f in FIELDS)
for f in FIELDS:
print(f"{f:30s} {totals[f]:>15,} {100 * totals[f] / grand:6.2f}%")
for key in ("requests", "output_tokens", "cache_read_input_tokens"):
print(f"median per session, {key}: {st.median(s[key] for s in sessions):,.0f}")
Порівняй свої частки з нашими. Рядок читань із кешу це перечитана розмова, а рядок записів у кеш це те, що було новим: ці два рядки кажуть про твій рахунок більше, ніж рядок виходу.
Де це показує AgentsRoom
Скрипт дає тобі місяць. Поки ти працюєш, AgentsRoom показує ті самі лічильники для кожного агента: значок токенів у полі введення кожної сесії, який стає червоним, коли сесія важчає, монітор сесії зі входом, виходом, записами в кеш, читаннями з кешу і часткою влучень у кеш, і трасування сесії, яке відтворює сесію хід за ходом і показує, яке читання файлу або який результат інструмента заповнив контекст. Панель використання розподіляє відсоток, який повідомляє твій план, між твоїми проєктами й агентами, зважуючи кожну сесію за тим, скільки вона коштувала б за цінами API, тим самим зважуванням, що й у таблиці вище.
Чого ніщо з цього не дає, так це балансу токенів, бо у твого плану його немає. Про це читай статтю скільки токенів у тебе залишилося в Claude. Про швидкість, з якою надходять ці вихідні токени, читай токени за секунду в Claude Code, виміряні.
Поширені запитання
Що таке токен у Claude?
Одиниця, в якій Claude читає і пише текст: шматочок слова, іноді ціле коротке слово, іноді один символ або байт. Anthropic уточнює, що розмір залежить від моделі та мови: на моделях до Claude 4.7 токен становив приблизно 3,5 англійського символу, а Claude 4.7 і новіші використовують новий токенізатор, який дає приблизно на 30% більше токенів на той самий текст. Усе, що робить Claude, вимірюється в токенах: те, що ти надсилаєш, те, що він пише у відповідь, і те, що він зберігає в кеші між ходами.
Скільки символів або слів в одному токені Claude?
Залежить від мови й від тексту. Anthropic називає приблизно 3,5 англійського символу на токен для моделей до Claude 4.7 і приблизно на 30% більше токенів на той самий текст для Claude 4.7 і новіших. На 296 суто текстових відповідях, які наші агенти написали французькою у вересні та жовтні 2026 року, токен становив 2,3 символу, тобто приблизно 2,6 токена на слово. Код, JSON і нелатинські писемності дають інші співвідношення. Для точного підрахунку ендпоінт підрахунку токенів Anthropic приймає текст і модель.
Чому Claude Code витрачає так багато токенів?
Бо кожен запит знову надсилає всю розмову: системний промпт, визначення інструментів, CLAUDE.md, кожне повідомлення і кожен результат інструмента від самого початку. На наших 19 668 запитах медіанний запит ніс 179 000 токенів контексту, щоб написати 290 токенів відповіді, а контекст зростав з 52 000 токенів на першому запиті сесії до 237 000 після п'ятдесяти запитів. Кеш робить це перечитування дешевим у перерахунку на токен, але воно все одно враховується.
Скільки токенів витрачає типова сесія Claude Code?
На наших 380 сесіях із трьох запитів і більше, записаних з 10 вересня по 9 жовтня 2026 року: у медіані 33 запити, 27 000 вихідних токенів і 5,4 мільйона оброблених токенів загалом, з них 5,1 мільйона читань із кешу. Половина сесій вкладалася в діапазон від 1,5 до 10,7 мільйона токенів. За публічними цінами API така медіанна сесія коштувала б приблизно 4,55 долара; на плані Pro або Max та сама робота натомість списується з 5-годинного й тижневого вікон.
Чи враховуються токени міркування?
Так. Токени міркування входять до output_tokens у кожному блоці usage, а поле thinking_tokens показує, яка частина виходу була міркуванням. В API вони оплачуються за ціною виходу, і Anthropic називає рівень зусиль серед того, що швидше витрачає ліміти плану. У нашому корпусі міркування становило 29% усього, що написали моделі.
Чим токени запису в кеш відрізняються від токенів читання з кешу?
Запис у кеш зберігає частину промпту, щоб наступний запит міг її повторно використати, і коштує дорожче за звичайний вхід: 1,25 ціни входу для 5-хвилинного кешу, 2 ціни для годинного кешу. Читання з кешу повторно використовує цю збережену частину і коштує набагато дешевше: 0,1 ціни входу на більшості моделей, 0,05 на Opus 5.5 і Sonnet 5.5, 0,025 на Fable 5.1. У наших сесіях читання з кешу становили 98% токенів і 46% вартості за публічними цінами; записи в кеш 2% токенів і 37% вартості.
Завантажити AgentsRoom
Запускайте всіх своїх AI-агентів на всіх своїх проєктах з одного вікна.
Додаток-компаньйон: контролюйте своїх агентів на ходу
Використовуйте свого: Claude, Codex, Antigravity CLI або іншого AI-провайдера.
Надсилайте баги та запити прямо у свій публічний беклог.
Читати далі
Як зберегти роботу Claude Code після розриву SSH: рецепт із tmux
Збережіть роботу Claude Code після розриву SSH за допомогою tmux. Поверніться до того самого процесу, перевірте сталість сесії та увімкніть опцію AgentsRoom.
Читати статтюRoutines у Claude Code: що працює в хмарі, що залишається на вашій машині і як вибрати
Routines дають Claude Code змогу запускати збережений промпт без вашої участі: за розкладом, за викликом API або за подією GitHub, у хмарній сесії на свіжому клоні вашого репозиторію. Вони перебувають у research preview. Claude Code також має два локальні способи планувати роботу, заплановані завдання десктопного застосунку і /loop, і всі три поводяться по-різному: мінімальний інтервал, доступ до ваших локальних файлів, запити дозволів, що відбувається, коли ноутбук спить. Цей посібник розкладає всі три варіанти з обмеженнями з документації, а потім пояснює, чому наші власні сім нічних агентів працюють на локальній машині.
Читати статтюСім AI-агентів працюють у нас ночами: агенти за розкладом не лише для коду, з промптами
Користувач запитав, як ми використовуємо AI-агентів для чогось, окрім написання коду. З 28 серпня щовечора на Mac mini запускаються сім агентів за розкладом: черговий CEO, SEO-команда, продакт-менеджер, фіксер багів, команда соцмереж, хранитель документації і репортер, який надсилає лист на 25 рядків. 33 ночі, 31 ранковий лист, 51 виправлений баг із посиланням на коміт, 7 статей у блозі 20 мовами. Що робить кожен, як вони передають одне одному роботу, не розмовляючи, яка модель виконує яку роботу, чотири правила, які довелося вивчити їхнім промптам, і самі промпти, готові до копіювання.
Читати статтю