Що таке токени в Claude і як вони працюють? Ми порахували 3,8 мільярда

Токен це шматочок слова, і Claude рахує їх чотирьох видів: вхід, запис у кеш, читання з кешу і вихід. Ми порахували 30 днів власних сесій Claude Code, 3,8 мільярда токенів: 98% становила розмова, перечитана з кешу, 0,3% те, що написав Claude. Скільки коштує кожен вид, чому сесія важчає з кожним ходом і що вимірює 5-годинне вікно.

Це слово трапляється навколо Claude всюди: у прайс-листі, у повідомленні про ліміт, у /usage, у кожній статті про економію. Майже ніхто не пояснює, що таке токен, а число, на яке дивляться люди, рідко виявляється тим, що важливе. Те, що Claude пише у відповідь, становить частку відсотка від того, що нараховує сесія програмування.

Тож ми порахували свої. Тридцять днів сесій Claude Code на одному Mac, з 10 вересня по 9 жовтня 2026 року: 388 сесій, 19 668 запитів до моделі, 3,8 мільярда токенів. Ось що таке токен, чотири способи, якими Claude їх рахує, і як ці числа виглядають на реальній роботі.

Токен це шматочок тексту, і розмір шматочка змінюється

Модель не читає ні літер, ні слів. Вона читає токени: шматочки тексту з фіксованого словника, іноді ціле коротке слово, часто частину слова, іноді один символ або байт для того, чого вона ніколи не бачила. Усе рахується в цих шматочках: те, що ти надсилаєш, те, що пише Claude, те, що він зберігає між ходами.

Скільки тексту вміщується в токен, залежить від моделі та від мови. Глосарій Anthropic називає приблизно 3,5 англійського символу на токен для моделей до Claude 4.7 і каже, що Claude 4.7 і новіші використовують новий токенізатор, який дає приблизно на 30% більше токенів на той самий текст. Точне число дає лише ендпоінт підрахунку токенів, з тією моделлю, яку ти збираєшся використовувати.

Ми виміряли співвідношення на власному тексті. Наші агенти відповідають французькою, тож ми взяли відповіді, що складаються лише з тексту, без міркування, без виклику інструмента, без блоку коду, щонайменше з 80 слів: 296 відповідей від Opus 5, Opus 5.5, Fable 5.1 і Sonnet 5.5. Медіана: 2,3 символу на токен, приблизно 2,6 токена на слово. Код, JSON і нелатинські писемності дають інші співвідношення. Суть не в точній цифрі: токен менший за слово, і вручну їх ніколи не рахують.

Кожен запит враховується на чотирьох лічильниках

Claude Code записує кожну сесію в JSONL-транскрипт у ~/.claude/projects/. Кожна відповідь моделі має блок usage. Ось справжній, із наших транскриптів, із залишеними корисними полями:

"usage": {
  "input_tokens": 2,
  "cache_creation_input_tokens": 51836,
  "cache_read_input_tokens": 24882,
  "output_tokens": 315,
  "output_tokens_details": { "thinking_tokens": 54 },
  "cache_creation": {
    "ephemeral_1h_input_tokens": 51836,
    "ephemeral_5m_input_tokens": 0
  }
}

Чотири лічильники, і коштують вони по-різному:

  • input_tokens: частина промпту, яка не записується в кеш і не читається з нього, оплачується за базовою ціною входу. У Claude Code це майже завжди жменька токенів, бо майже все йде через кеш.
  • cache_creation_input_tokens: частина промпту, збережена в кеші, щоб наступний запит міг її повторно використати. Запис у кеш коштує 1,25 ціни входу для 5-хвилинного кешу і 2 ціни для годинного. У наших транскриптах 97% записів були годинними.
  • cache_read_input_tokens: частина промпту, відтворена з кешу. Читання з кешу коштує 0,1 ціни входу на більшості моделей, 0,05 на Opus 5.5 і Sonnet 5.5 і 0,025 на Fable 5.1 (сторінка Anthropic про кешування промптів, перевірено 10 жовтня 2026 року).
  • output_tokens: те, що пише Claude, разом із міркуванням. Вихід коштує в 5 разів дорожче за вхід на всіх поточних моделях: 20 доларів за мільйон на Opus 5.5, 25 на Opus 5, 50 на Fable 5.1, 10 на Sonnet 5.5.

Перші три в сумі дають контекст, який модель прочитала для цього запиту. Четвертий це відповідь.

Як виглядають 30 днів наших сесій

За 19 668 запитами, кожен порахований один раз (один виклик API може займати кілька рядків транскрипту):

ЛічильникТокениЧастка токенівЧастка вартості за публічними цінами API
Вхід (без кешу)114 4110,003%0,04%
Записи в кеш74 834 0702,0%37,4%
Читання з кешу3 710 054 70997,7%45,7%
Вихід12 727 1930,34%16,8%
Разом3 797 730 383100%2 563 долари

Стовпець вартості оцінює кожен запит за його власною моделлю і його власною тривалістю кешу. Ми не платимо цю суму: ці сесії йшли за підпискою. Це вага кожного лічильника, те саме зважування, яке AgentsRoom використовує, щоб розподілити відсоток плану між проєктами.

Три висновки.

Майже кожен токен це перечитана розмова. 97,7% токенів припадає на читання з кешу. 99,2% запитів щось читають із кешу. Коли кажуть, що сесія «витратила 50 мільйонів токенів», дивляться саме на це.

Те, що пише Claude, крихітне в токенах і зовсім не крихітне в грошах. 0,34% токенів, 16,8% рахунку, бо вихід це найдорожчий токен з усіх. Міркування становило 29% цього виходу.

Записи в кеш виявляються дорогим сюрпризом. 2% токенів, 37% вартості. Ми очікували, що вони виникають через спливання кешу, але лише 16 запитам із 19 668 довелося заново записати холодний контекст, сімом із них після понад години тиші. 79% записів це просто кожне нове повідомлення і кожен результат інструмента, збережені один раз за подвійною ціною входу, перш ніж їх перечитують на кожному наступному ході. Решта 20% припадає на перший запит кожної сесії.

Чому сесія важчає з кожним ходом

Модель нічого не зберігає між двома запитами. Claude Code щоразу надсилає все заново: системний промпт, визначення інструментів, CLAUDE.md, кожне повідомлення, кожен прочитаний файл, кожен вивід команди. Кеш робить повторювану частину дешевою в перерахунку на токен, але не безкоштовною і не меншою.

Медіанний контекст, прочитаний за запит, за позицією в сесії:

Запит у сесіїЗапитиМедіанний контекст
1-й38852 000 токенів
З 2-го по 10-й3 21093 000 токенів
З 11-го по 50-й8 546161 000 токенів
З 51-го по 200-й6 414237 000 токенів
Після 200-го1 110342 000 токенів

Медіанний запит читав 179 000 токенів контексту, щоб написати 290 токенів відповіді. У цьому співвідношенні вся історія токенів в агенті для програмування: відповідь коротка, читання довге, і читання зростає разом із сесією.

Наш перший запит важкий, 52 000 токенів ще до того, як хтось щось набрав, бо наші агенти стартують із довгим описом ролі та чотирма MCP-серверами, чиї визначення інструментів лежать у промпті. Гола сесія Claude Code в порожній теці стартує набагато нижче. /context показує, що несе твоя сесія до першого повідомлення.

Скільки витрачає одна сесія

За 380 сесіями щонайменше з трьох запитів:

  • 33 запити в медіані, від 16 до 61 для середньої половини.
  • 27 000 вихідних токенів у медіані, від 12 000 до 48 000.
  • 5,4 мільйона оброблених токенів у медіані, від 1,5 до 10,7 мільйона для середньої половини, з них 5,1 мільйона читань із кешу.
  • 181 000 токенів, записаних у кеш або надісланих без кешу, в медіані: та частина, яка справді була новою.
  • 4,55 долара за публічними цінами API в медіані, від 1,81 до 9,25 для середньої половини.

Отже, чесна відповідь на запитання «скільки токенів витрачає сесія програмування» така: діапазон приблизно від одного до десяти мільйонів, майже повністю той самий контекст, прочитаний заново. Сесія, яка всю другу половину дня працює над одним довгим завданням, перебуває у верхній частині діапазону; сесія, яка виправляє один баг і зупиняється, у нижній.

Що насправді рахують 5-годинне вікно і тиждень

На плані Pro або Max ти ніколи не бачиш балансу токенів. Довідковий центр Anthropic каже, що обидва плани мають п'ятигодинний ліміт сесії та тижневий ліміт, що ці ліміти спільні для Claude і Claude Code (включно з IDE) і що плани Max мають окремий тижневий ліміт для Fable. Для жодного з них він не публікує цифру в токенах. /usage показує відсоток кожного вікна і час, коли воно поновиться.

Що зсуває цей відсоток, за власним списком Anthropic: довжина повідомлення, розмір вкладень, довжина поточної розмови, використання інструментів, вибір моделі, рівень зусиль і багатокрокові завдання. Якщо читати разом із таблицями вище, у сесії програмування домінує саме «довжина поточної розмови»: контекст, що читається на кожному запиті, зростає з 52 000 до 237 000 токенів за п'ятдесят запитів. Довідковий центр також каже, що кешований вміст у проєктах менше витрачає твої ліміти під час повторного використання, і це та сама ідея, що й ціна читання з кешу.

Ми не знаємо, як Anthropic переводить токени у відсоток вікна, і не вигадуватимемо перерахунок. Натомість дані кажуть, що пізній запит у довгій сесії враховується в кілька разів більше, ніж ранній, за те саме запитання.

Що змінює рахунок на практиці

Чотири важелі, у порядку їхньої ваги на наших даних:

  • /clear між не пов'язаними завданнями. Anthropic називає його «найефективнішим важелем і для якості, і для вартості». Нове завдання в старій сесії на кожному запиті оплачує контекст старого завдання.
  • /compact, коли продовжуєш довгу сесію. Він замінює історію коротким підсумком, тож наступні запити читають менше.
  • Стеж за тим, що потрапляє в контекст. Читання файлу або вивід команди на 20 000 токенів записується один раз за подвійною ціною входу, а потім перечитується на кожному наступному запиті до кінця сесії. Читати потрібні рядки замість усього файлу вигідно двічі.
  • Модель і рівень зусиль. Міркування становило 29% нашого виходу, а вихід це найдорожчий токен. Нижчий рівень зусиль на рутинній роботі зменшує вихід, а дешевша модель знижує одразу всі ціни.

Що не відіграло ролі на наших даних: залишати сесію без діла. З годинним кешем, який Claude Code використовує в наших транскриптах, холодний перезапис стався 16 разів за 30 днів.

Інші способи витрачати менше описано в статті як зменшити витрати на токени Claude Code.

Порахуй свої

Таблиця вище отримана скриптом без залежностей. Він читає всі транскрипти Claude Code на машині, рахує кожен запит один раз і виводить чотири лічильники та медіани за сесіями. Додай фільтр за o["timestamp"], якщо потрібен часовий проміжок.

import json, glob, os, statistics as st
from collections import defaultdict

FIELDS = ("input_tokens", "cache_creation_input_tokens",
          "cache_read_input_tokens", "output_tokens")
totals, sessions = defaultdict(int), []
for path in glob.glob(os.path.expanduser("~/.claude/projects/*/*.jsonl")):
    seen, session = set(), defaultdict(int)
    with open(path, errors="ignore") as fh:
        for line in fh:
            try: o = json.loads(line)
            except ValueError: continue
            msg = o.get("message") or {}
            usage = msg.get("usage") if isinstance(msg, dict) else None
            if o.get("type") != "assistant" or not usage: continue
            rid = o.get("requestId") or o.get("uuid")
            if rid in seen: continue   # one API call can span several lines
            seen.add(rid)
            session["requests"] += 1
            for f in FIELDS:
                n = usage.get(f) or 0
                totals[f] += n
                session[f] += n
    if session["requests"] >= 3: sessions.append(session)

grand = sum(totals[f] for f in FIELDS)
for f in FIELDS:
    print(f"{f:30s} {totals[f]:>15,} {100 * totals[f] / grand:6.2f}%")
for key in ("requests", "output_tokens", "cache_read_input_tokens"):
    print(f"median per session, {key}: {st.median(s[key] for s in sessions):,.0f}")

Порівняй свої частки з нашими. Рядок читань із кешу це перечитана розмова, а рядок записів у кеш це те, що було новим: ці два рядки кажуть про твій рахунок більше, ніж рядок виходу.

Де це показує AgentsRoom

Скрипт дає тобі місяць. Поки ти працюєш, AgentsRoom показує ті самі лічильники для кожного агента: значок токенів у полі введення кожної сесії, який стає червоним, коли сесія важчає, монітор сесії зі входом, виходом, записами в кеш, читаннями з кешу і часткою влучень у кеш, і трасування сесії, яке відтворює сесію хід за ходом і показує, яке читання файлу або який результат інструмента заповнив контекст. Панель використання розподіляє відсоток, який повідомляє твій план, між твоїми проєктами й агентами, зважуючи кожну сесію за тим, скільки вона коштувала б за цінами API, тим самим зважуванням, що й у таблиці вище.

Чого ніщо з цього не дає, так це балансу токенів, бо у твого плану його немає. Про це читай статтю скільки токенів у тебе залишилося в Claude. Про швидкість, з якою надходять ці вихідні токени, читай токени за секунду в Claude Code, виміряні.

Поширені запитання

Що таке токен у Claude?

Одиниця, в якій Claude читає і пише текст: шматочок слова, іноді ціле коротке слово, іноді один символ або байт. Anthropic уточнює, що розмір залежить від моделі та мови: на моделях до Claude 4.7 токен становив приблизно 3,5 англійського символу, а Claude 4.7 і новіші використовують новий токенізатор, який дає приблизно на 30% більше токенів на той самий текст. Усе, що робить Claude, вимірюється в токенах: те, що ти надсилаєш, те, що він пише у відповідь, і те, що він зберігає в кеші між ходами.

Скільки символів або слів в одному токені Claude?

Залежить від мови й від тексту. Anthropic називає приблизно 3,5 англійського символу на токен для моделей до Claude 4.7 і приблизно на 30% більше токенів на той самий текст для Claude 4.7 і новіших. На 296 суто текстових відповідях, які наші агенти написали французькою у вересні та жовтні 2026 року, токен становив 2,3 символу, тобто приблизно 2,6 токена на слово. Код, JSON і нелатинські писемності дають інші співвідношення. Для точного підрахунку ендпоінт підрахунку токенів Anthropic приймає текст і модель.

Чому Claude Code витрачає так багато токенів?

Бо кожен запит знову надсилає всю розмову: системний промпт, визначення інструментів, CLAUDE.md, кожне повідомлення і кожен результат інструмента від самого початку. На наших 19 668 запитах медіанний запит ніс 179 000 токенів контексту, щоб написати 290 токенів відповіді, а контекст зростав з 52 000 токенів на першому запиті сесії до 237 000 після п'ятдесяти запитів. Кеш робить це перечитування дешевим у перерахунку на токен, але воно все одно враховується.

Скільки токенів витрачає типова сесія Claude Code?

На наших 380 сесіях із трьох запитів і більше, записаних з 10 вересня по 9 жовтня 2026 року: у медіані 33 запити, 27 000 вихідних токенів і 5,4 мільйона оброблених токенів загалом, з них 5,1 мільйона читань із кешу. Половина сесій вкладалася в діапазон від 1,5 до 10,7 мільйона токенів. За публічними цінами API така медіанна сесія коштувала б приблизно 4,55 долара; на плані Pro або Max та сама робота натомість списується з 5-годинного й тижневого вікон.

Чи враховуються токени міркування?

Так. Токени міркування входять до output_tokens у кожному блоці usage, а поле thinking_tokens показує, яка частина виходу була міркуванням. В API вони оплачуються за ціною виходу, і Anthropic називає рівень зусиль серед того, що швидше витрачає ліміти плану. У нашому корпусі міркування становило 29% усього, що написали моделі.

Чим токени запису в кеш відрізняються від токенів читання з кешу?

Запис у кеш зберігає частину промпту, щоб наступний запит міг її повторно використати, і коштує дорожче за звичайний вхід: 1,25 ціни входу для 5-хвилинного кешу, 2 ціни для годинного кешу. Читання з кешу повторно використовує цю збережену частину і коштує набагато дешевше: 0,1 ціни входу на більшості моделей, 0,05 на Opus 5.5 і Sonnet 5.5, 0,025 на Fable 5.1. У наших сесіях читання з кешу становили 98% токенів і 46% вартості за публічними цінами; записи в кеш 2% токенів і 37% вартості.

Завантажити AgentsRoom

Запускайте всіх своїх AI-агентів на всіх своїх проєктах з одного вікна.

БезкоштовноЗавантажити AgentsRoom

Додаток-компаньйон: контролюйте своїх агентів на ходу

Використовуйте свого: Claude, Codex, Antigravity CLI або іншого AI-провайдера.

Отримати розширення
Chrome Web Store

Надсилайте баги та запити прямо у свій публічний беклог.

Кілька проектів
Багато постачальників
Кілька агентів
Статус в реальному часі
Різниця файлів і коміт
Мобільний компаньйон
Попередній перегляд в реальному часі
Команди агентів
Автоматизація браузера
Розробка, орієнтована на беклог
Бібліотека підказок
Бібліотека навичок
Переглянути всі функції

Читати далі