Apa Itu Token di Claude dan Bagaimana Cara Kerjanya? Kami Menghitung 3,8 Miliar

Token adalah potongan kata, dan Claude menghitung empat jenisnya: input, tulis cache, baca cache, dan output. Kami menghitung 30 hari sesi Claude Code kami sendiri, 3,8 miliar token: 98% adalah percakapan yang dibaca ulang dari cache, 0,3% adalah apa yang ditulis Claude. Berapa biaya setiap jenis, mengapa sesi makin berat di setiap giliran, dan apa yang diukur oleh jendela 5 jam.

Anda menemukan kata ini di mana-mana seputar Claude: di daftar harga, di pesan limit, di /usage, di setiap artikel tentang cara berhemat. Hampir tidak ada yang menjelaskan apa itu token, dan angka yang dilihat orang jarang merupakan angka yang penting. Bagian yang ditulis Claude sebagai jawaban hanya sepersekian persen dari apa yang dihitung dalam sebuah sesi coding.

Jadi kami menghitung milik kami sendiri. Tiga puluh hari sesi Claude Code di satu Mac, dari 10 September hingga 9 Oktober 2026: 388 sesi, 19.668 permintaan ke model, 3,8 miliar token. Inilah apa itu token, empat cara Claude menghitungnya, dan seperti apa angka-angka itu dalam pekerjaan nyata.

Token adalah potongan teks, dan ukuran potongannya berubah-ubah

Model tidak membaca huruf atau kata. Model membaca token: potongan teks dari kosakata yang tetap, kadang satu kata pendek utuh, sering kali bagian dari sebuah kata, kadang satu karakter atau satu byte untuk sesuatu yang belum pernah dilihatnya. Semuanya dihitung dalam potongan-potongan itu: apa yang Anda kirim, apa yang ditulis Claude, apa yang disimpannya antar giliran.

Seberapa banyak teks yang muat dalam satu token bergantung pada model dan bahasa. Glosarium Anthropic menyebut sekitar 3,5 karakter bahasa Inggris per token pada model sebelum Claude 4.7, dan menyatakan bahwa Claude 4.7 ke atas memakai tokenizer baru yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama. Jumlah yang tepat hanya didapat dari endpoint penghitung token, dengan model yang ingin Anda pakai.

Kami mengukur rasionya pada teks kami sendiri. Agent kami menjawab dalam bahasa Prancis, jadi kami mengambil jawaban yang hanya berupa teks biasa, tanpa proses berpikir, tanpa pemanggilan tool, tanpa blok kode, minimal 80 kata: 296 jawaban dari Opus 5, Opus 5.5, Fable 5.1, dan Sonnet 5.5. Mediannya 2,3 karakter per token, sekitar 2,6 token per kata. Kode, JSON, dan aksara non-Latin memberi rasio yang berbeda. Intinya bukan angka pastinya: token lebih kecil daripada kata, dan Anda tidak pernah menghitungnya dengan tangan.

Setiap permintaan dihitung di empat penghitung

Claude Code menulis setiap sesi ke transkrip JSONL di bawah ~/.claude/projects/. Setiap jawaban dari model membawa blok usage. Berikut contoh nyata dari transkrip kami, dengan field yang berguna saja:

"usage": {
  "input_tokens": 2,
  "cache_creation_input_tokens": 51836,
  "cache_read_input_tokens": 24882,
  "output_tokens": 315,
  "output_tokens_details": { "thinking_tokens": 54 },
  "cache_creation": {
    "ephemeral_1h_input_tokens": 51836,
    "ephemeral_5m_input_tokens": 0
  }
}

Empat penghitung, dan harganya tidak sama:

  • input_tokens: bagian prompt yang tidak ditulis ke cache maupun dibaca dari cache, ditagih dengan harga input dasar. Di Claude Code, bagian ini hampir selalu hanya beberapa token, karena hampir semuanya melewati cache.
  • cache_creation_input_tokens: bagian prompt yang disimpan di cache agar permintaan berikutnya bisa memakainya lagi. Tulis cache berbiaya 1,25 kali harga input untuk cache 5 menit dan 2 kali untuk cache 1 jam. Dalam transkrip kami, 97% penulisan adalah jenis 1 jam.
  • cache_read_input_tokens: bagian prompt yang diputar ulang dari cache. Baca cache berbiaya 0,1 kali harga input pada sebagian besar model, 0,05 kali pada Opus 5.5 dan Sonnet 5.5, dan 0,025 kali pada Fable 5.1 (halaman prompt caching Anthropic, diperiksa pada 10 Oktober 2026).
  • output_tokens: apa yang ditulis Claude, termasuk proses berpikir. Output berbiaya 5 kali harga input pada semua model saat ini: 20 dolar per juta token pada Opus 5.5, 25 pada Opus 5, 50 pada Fable 5.1, 10 pada Sonnet 5.5.

Tiga penghitung pertama dijumlahkan menjadi konteks yang dibaca model untuk permintaan ini. Yang keempat adalah jawabannya.

Seperti apa 30 hari sesi kami

Dari 19.668 permintaan, masing-masing dihitung satu kali (satu panggilan API bisa memenuhi beberapa baris transkrip):

PenghitungTokenPorsi dari tokenPorsi dari biaya dengan harga resmi API
Input (tanpa cache)114.4110,003%0,04%
Tulis cache74.834.0702,0%37,4%
Baca cache3.710.054.70997,7%45,7%
Output12.727.1930,34%16,8%
Total3.797.730.383100%2.563 dolar

Kolom biaya menghitung harga setiap permintaan dengan model dan durasi cache-nya sendiri. Kami tidak membayar jumlah itu: sesi-sesi ini berjalan di atas langganan. Itu adalah bobot setiap penghitung, pembobotan yang sama yang dipakai AgentsRoom untuk membagi persentase sebuah paket ke berbagai proyek.

Tiga catatan.

Hampir setiap token adalah percakapan yang dibaca ulang. 97,7% token adalah baca cache. 99,2% permintaan membaca sesuatu dari cache. Ketika orang bilang sebuah sesi "memakai 50 juta token", inilah yang sedang mereka lihat.

Yang ditulis Claude kecil dalam token, tapi tidak kecil dalam biaya. 0,34% token, 16,8% tagihan, karena output adalah token paling mahal yang ada. Proses berpikir mencakup 29% dari output itu.

Tulis cache adalah kejutan yang mahal. 2% token, 37% biaya. Kami mengira biaya itu berasal dari cache yang kedaluwarsa, tetapi hanya 16 dari 19.668 permintaan yang harus menulis ulang konteks yang sudah dingin, tujuh di antaranya setelah lebih dari satu jam tanpa aktivitas. 79% penulisan hanyalah setiap pesan baru dan setiap hasil tool yang disimpan satu kali, dengan dua kali harga input, sebelum dibaca ulang di setiap giliran berikutnya. 20% sisanya adalah permintaan pertama setiap sesi.

Mengapa sesi makin berat di setiap giliran

Model tidak menyimpan apa pun di antara dua permintaan. Claude Code mengirim ulang semuanya setiap kali: prompt sistem, definisi tool, CLAUDE.md, setiap pesan, setiap file yang dibacanya, setiap output perintah. Cache membuat bagian yang berulang murah per token, bukan gratis, dan tidak menjadi lebih kecil.

Median konteks yang dibaca per permintaan, menurut posisinya dalam sesi:

Permintaan dalam sesiPermintaanMedian konteks
Ke-138852.000 token
Ke-2 sampai ke-103.21093.000 token
Ke-11 sampai ke-508.546161.000 token
Ke-51 sampai ke-2006.414237.000 token
Setelah ke-2001.110342.000 token

Permintaan median membaca 179.000 token konteks untuk menulis 290 token jawaban. Rasio itulah seluruh cerita tentang token dalam agent coding: jawabannya pendek, bacaannya panjang, dan bacaannya bertambah seiring sesi berjalan.

Permintaan pertama kami sudah berat, 52.000 token sebelum siapa pun mengetik apa pun, karena agent kami dimulai dengan arahan peran yang panjang dan empat server MCP yang definisi tool-nya berada di dalam prompt. Sesi Claude Code polos di folder kosong dimulai jauh lebih rendah. /context menampilkan apa yang dibawa sesi Anda sebelum pesan pertama.

Berapa yang dipakai satu sesi

Dari 380 sesi yang berisi setidaknya tiga permintaan:

  • 33 permintaan pada median, 16 sampai 61 untuk separuh tengah.
  • 27.000 token output pada median, 12.000 sampai 48.000.
  • 5,4 juta token diproses pada median, 1,5 sampai 10,7 juta untuk separuh tengah, 5,1 juta di antaranya baca cache.
  • 181.000 token ditulis ke cache atau dikirim tanpa cache pada median: bagian yang benar-benar baru.
  • 4,55 dolar dengan harga resmi API pada median, 1,81 sampai 9,25 untuk separuh tengah.

Jadi jawaban jujur untuk pertanyaan "berapa token yang dipakai satu sesi coding" adalah kisaran sekitar satu sampai sepuluh juta, hampir semuanya konteks yang sama yang dibaca ulang. Sesi yang berjalan sepanjang sore untuk satu tugas panjang berada di ujung atas kisaran itu; sesi yang memperbaiki satu bug lalu berhenti berada di ujung bawah.

Apa yang sebenarnya dihitung jendela 5 jam dan jendela mingguan

Pada paket Pro atau Max, Anda tidak pernah melihat saldo token. Pusat bantuan Anthropic menyebut bahwa kedua paket memiliki limit sesi lima jam dan limit mingguan, bahwa limit ini dipakai bersama oleh Claude dan Claude Code (termasuk IDE), dan bahwa paket Max memiliki limit mingguan terpisah untuk Fable. Anthropic tidak memublikasikan angka token untuk satu pun dari limit itu. /usage menampilkan persentase setiap jendela, dan waktu jendela itu di-reset.

Yang menggerakkan persentase itu, menurut daftar Anthropic sendiri: panjang pesan, ukuran lampiran, panjang percakapan saat ini, penggunaan tool, pilihan model, tingkat upaya, dan tugas multi-langkah. Jika dibaca bersama tabel di atas, "panjang percakapan saat ini" adalah faktor yang mendominasi sesi coding: konteks yang dibaca di setiap permintaan tumbuh dari 52.000 menjadi 237.000 token dalam lima puluh permintaan. Pusat bantuan juga menyebut bahwa konten yang di-cache dalam proyek dihitung lebih sedikit terhadap limit Anda saat dipakai ulang, gagasan yang sama dengan harga baca cache.

Kami tidak tahu bagaimana Anthropic mengonversi token menjadi persentase sebuah jendela, dan kami tidak akan mengarang konversinya. Yang dikatakan data adalah bahwa permintaan di bagian akhir sesi panjang dihitung beberapa kali lipat dibanding permintaan di awal, untuk pertanyaan yang sama.

Apa yang mengubah hitungannya, dalam praktik

Empat tuas, diurutkan menurut seberapa besar pengaruhnya pada data kami:

  • /clear di antara tugas yang tidak berkaitan. Anthropic menyebutnya "tuas paling efektif, baik untuk kualitas maupun biaya". Tugas baru di sesi lama membayar konteks tugas lama di setiap permintaan.
  • /compact saat Anda melanjutkan sesi yang panjang. Perintah ini mengganti riwayat dengan ringkasan pendek, sehingga permintaan berikutnya membaca lebih sedikit.
  • Perhatikan apa yang masuk ke konteks. Pembacaan file atau output perintah sebesar 20.000 token ditulis satu kali dengan dua kali harga input, lalu dibaca ulang di setiap permintaan berikutnya sampai sesi berakhir. Membaca baris yang Anda perlukan saja, bukan seluruh file, menghemat dua kali.
  • Model dan tingkat upaya. Proses berpikir mencakup 29% output kami, dan output adalah token paling mahal. Tingkat upaya yang lebih rendah untuk pekerjaan rutin menurunkan output, dan model yang lebih murah menurunkan semua harga sekaligus.

Yang tidak berpengaruh pada data kami: membiarkan sesi menganggur. Dengan cache 1 jam yang dipakai Claude Code dalam transkrip kami, penulisan ulang dari cache dingin terjadi 16 kali dalam 30 hari.

Untuk cara lain agar lebih hemat, baca cara memangkas biaya token Claude Code.

Hitung milik Anda

Tabel di atas berasal dari skrip tanpa dependensi. Skrip ini membaca setiap transkrip Claude Code di mesin, menghitung setiap permintaan satu kali, lalu mencetak keempat penghitung dan median per sesi. Tambahkan filter pada o["timestamp"] jika Anda ingin membatasi rentang waktu.

import json, glob, os, statistics as st
from collections import defaultdict

FIELDS = ("input_tokens", "cache_creation_input_tokens",
          "cache_read_input_tokens", "output_tokens")
totals, sessions = defaultdict(int), []
for path in glob.glob(os.path.expanduser("~/.claude/projects/*/*.jsonl")):
    seen, session = set(), defaultdict(int)
    with open(path, errors="ignore") as fh:
        for line in fh:
            try: o = json.loads(line)
            except ValueError: continue
            msg = o.get("message") or {}
            usage = msg.get("usage") if isinstance(msg, dict) else None
            if o.get("type") != "assistant" or not usage: continue
            rid = o.get("requestId") or o.get("uuid")
            if rid in seen: continue   # one API call can span several lines
            seen.add(rid)
            session["requests"] += 1
            for f in FIELDS:
                n = usage.get(f) or 0
                totals[f] += n
                session[f] += n
    if session["requests"] >= 3: sessions.append(session)

grand = sum(totals[f] for f in FIELDS)
for f in FIELDS:
    print(f"{f:30s} {totals[f]:>15,} {100 * totals[f] / grand:6.2f}%")
for key in ("requests", "output_tokens", "cache_read_input_tokens"):
    print(f"median per session, {key}: {st.median(s[key] for s in sessions):,.0f}")

Bandingkan porsi Anda dengan porsi kami. Baris baca cache adalah percakapan yang dibaca ulang, dan baris tulis cache adalah bagian yang baru: dua baris itu lebih banyak bercerita tentang tagihan Anda daripada baris output.

Di mana AgentsRoom menampilkannya

Skrip memberi Anda gambaran satu bulan. Selama Anda bekerja, AgentsRoom menampilkan penghitung yang sama per agent: badge token di composer setiap sesi yang berubah merah saat sesi mulai berat, monitor sesi dengan input, output, tulis cache, baca cache, dan tingkat cache hit, serta jejak sesi yang memutar ulang sesi giliran demi giliran untuk menunjukkan pembacaan file atau hasil tool mana yang memenuhi konteks. Panel usage membagi persentase yang dilaporkan paket Anda ke proyek dan agent Anda, dengan membobot setiap sesi berdasarkan biayanya jika dihitung dengan harga API, pembobotan yang sama dengan tabel di atas.

Yang tidak diberikan oleh semua itu adalah saldo token, karena paket Anda memang tidak memilikinya. Untuk pertanyaan itu, baca berapa token yang masih tersisa di Claude. Untuk kecepatan datangnya token output itu, baca token per detik Claude Code, hasil pengukuran.

Pertanyaan yang sering diajukan

Apa itu token di Claude?

Satuan yang dipakai Claude untuk membaca dan menulis teks: potongan kata, kadang satu kata pendek utuh, kadang satu karakter atau satu byte saja. Anthropic menyebut ukurannya bergantung pada model dan bahasa: pada model sebelum Claude 4.7, satu token kira-kira 3,5 karakter bahasa Inggris, dan Claude 4.7 ke atas memakai tokenizer baru yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama. Semua yang dilakukan Claude diukur dalam token: apa yang Anda kirim, apa yang ditulisnya kembali, dan apa yang disimpannya di cache antar giliran.

Satu token Claude itu berapa karakter atau berapa kata?

Tergantung bahasa dan teksnya. Anthropic menyebut sekitar 3,5 karakter bahasa Inggris per token pada model sebelum Claude 4.7, dan sekitar 30% lebih banyak token untuk teks yang sama pada Claude 4.7 ke atas. Pada 296 jawaban berupa teks biasa yang ditulis agent kami dalam bahasa Prancis pada September dan Oktober 2026, satu token sama dengan 2,3 karakter, atau sekitar 2,6 token per kata. Kode, JSON, dan aksara non-Latin memberi rasio yang berbeda. Untuk jumlah yang tepat, endpoint penghitung token Anthropic menerima teks dan modelnya.

Mengapa Claude Code memakai begitu banyak token?

Karena setiap permintaan mengirim ulang seluruh percakapan: prompt sistem, definisi tool, CLAUDE.md, setiap pesan, dan setiap hasil tool sejauh ini. Dari 19.668 permintaan kami, permintaan median membawa 179.000 token konteks untuk menulis 290 token jawaban, dan konteksnya tumbuh dari 52.000 token pada permintaan pertama sebuah sesi menjadi 237.000 setelah lima puluh permintaan. Cache membuat pembacaan ulang itu murah per token, tetapi tetap dihitung.

Berapa token yang dipakai sesi Claude Code pada umumnya?

Dari 380 sesi kami yang berisi tiga permintaan atau lebih, tercatat antara 10 September dan 9 Oktober 2026: median 33 permintaan, 27.000 token output, dan total 5,4 juta token diproses, 5,1 juta di antaranya baca cache. Separuh sesi berada di antara 1,5 dan 10,7 juta token. Dengan harga resmi API, sesi median itu akan menelan biaya sekitar 4,55 dolar; pada paket Pro atau Max, pekerjaan yang sama dihitung terhadap jendela 5 jam dan jendela mingguan.

Apakah token berpikir ikut dihitung?

Ya. Token berpikir adalah bagian dari output_tokens di setiap blok usage, dengan field thinking_tokens yang menyebut seberapa banyak output yang berupa proses berpikir. Di API, token ini ditagih dengan harga output, dan Anthropic mencantumkan tingkat upaya di antara hal-hal yang membuat limit penggunaan sebuah paket lebih cepat habis. Dalam korpus kami, proses berpikir mencakup 29% dari semua yang ditulis model.

Apa beda token tulis cache dan token baca cache?

Tulis cache menyimpan sebagian prompt agar permintaan berikutnya bisa memakainya lagi, dan biayanya lebih mahal daripada input biasa: 1,25 kali harga input untuk cache 5 menit, 2 kali untuk cache 1 jam. Baca cache memakai ulang bagian yang tersimpan itu dan jauh lebih murah: 0,1 kali harga input pada sebagian besar model, 0,05 kali pada Opus 5.5 dan Sonnet 5.5, 0,025 kali pada Fable 5.1. Dalam sesi kami, baca cache mencakup 98% token dan 46% biaya dengan harga resmi; tulis cache mencakup 2% token dan 37% biaya.

Unduh AgentsRoom

Jalankan semua agen AI Anda, di semua proyek Anda, dari satu jendela.

GratisUnduh AgentsRoom

Aplikasi pendamping: pantau agen Anda saat bepergian

Gunakan Claude, Codex, Antigravity CLI, atau penyedia AI lainnya.

Dapatkan ekstensi
Chrome Web Store

Kirim bug dan permintaan langsung ke backlog publik Anda.

Beberapa proyek
Multi-penyedia
Beberapa agen
Status langsung
File diff & commit
Pendamping mobile
Pratinjau langsung
Tim agen
Otomatisasi browser
Dev berbasis backlog
Pustaka prompt
Pustaka skill
Lihat semua fitur

Lanjutkan membaca