ما هي التوكنات في Claude وكيف تعمل؟ أحصينا 3.8 مليار توكن
التوكن جزء من كلمة، وClaude يحصي منه أربعة أنواع: المدخلات، وكتابات ذاكرة التخزين المؤقت، وقراءات ذاكرة التخزين المؤقت، والمخرجات. أحصينا 30 يوماً من جلسات Claude Code الخاصة بنا، 3.8 مليار توكن: 98% منها كانت المحادثة تُعاد قراءتها من ذاكرة التخزين المؤقت، و0.3% فقط ما كتبه Claude. كم يكلّف كل نوع، ولماذا تثقل الجلسة مع كل دورة، وما الذي تقيسه نافذة الخمس ساعات.
تصادف الكلمة في كل مكان حول Claude: في قائمة الأسعار، وفي رسالة بلوغ الحد، وفي /usage، وفي كل مقال يعدك بالتوفير. لا يكاد أحد يشرح ما هو التوكن، والرقم الذي ينظر إليه الناس نادراً ما يكون الرقم المهم. فالجزء الذي يكتبه Claude رداً عليك لا يتجاوز جزءاً من الواحد في المئة مما تحتسبه جلسة برمجة.
لذلك أحصينا توكناتنا. ثلاثون يوماً من جلسات Claude Code على جهاز Mac واحد، من 10 سبتمبر إلى 9 أكتوبر 2026: 388 جلسة، و19,668 طلباً إلى النموذج، و3.8 مليار توكن. إليك ما هو التوكن، والطرق الأربع التي يحصيه بها Claude، وكيف تبدو هذه الأرقام في عمل حقيقي.
التوكن جزء من نص، وحجم هذا الجزء يتغير
النموذج لا يقرأ حروفاً ولا كلمات. إنه يقرأ توكنات: أجزاء من النص مأخوذة من مفردات ثابتة، أحياناً كلمة قصيرة كاملة، وغالباً جزء من كلمة، وأحياناً حرف واحد أو بايت واحد لشيء لم يره من قبل. كل شيء يُحتسب بهذه الأجزاء: ما ترسله، وما يكتبه Claude، وما يحتفظ به بين دورة وأخرى.
كمية النص التي يتسع لها التوكن تتوقف على النموذج وعلى اللغة. يذكر مسرد Anthropic نحو 3.5 حرف إنجليزي لكل توكن في النماذج السابقة لـ Claude 4.7، ويقول إن Claude 4.7 وما بعده تستخدم أداة تقسيم أحدث (tokenizer) تنتج نحو 30% من التوكنات الإضافية للنص نفسه. العدد الدقيق لا يأتي إلا من نقطة نهاية عدّ التوكنات، مع النموذج الذي تنوي استخدامه.
قسنا النسبة على نصوصنا نحن. وكلاؤنا يردّون بالفرنسية، فأخذنا الردود النصية الخالصة فقط، بلا تفكير، ولا استدعاء أداة، ولا كتلة كود، وبطول 80 كلمة على الأقل: 296 رداً موزعة على Opus 5 وOpus 5.5 وFable 5.1 وSonnet 5.5. كان الوسيط 2.3 حرف لكل توكن، أي نحو 2.6 توكن لكل كلمة. الكود وJSON والكتابات غير اللاتينية تعطي نسباً أخرى. المهم ليس الرقم الدقيق: التوكن أصغر من الكلمة، ولن تعدّه بيدك أبداً.
كل طلب يُحتسب على أربعة عدّادات
يكتب Claude Code كل جلسة في سجل JSONL تحت ~/.claude/projects/. وكل رد من النموذج يحمل كتلة usage. إليك واحدة حقيقية من سجلاتنا، مع الإبقاء على الحقول المفيدة:
"usage": {
"input_tokens": 2,
"cache_creation_input_tokens": 51836,
"cache_read_input_tokens": 24882,
"output_tokens": 315,
"output_tokens_details": { "thinking_tokens": 54 },
"cache_creation": {
"ephemeral_1h_input_tokens": 51836,
"ephemeral_5m_input_tokens": 0
}
}
أربعة عدّادات، ولا تكلّف الشيء نفسه:
input_tokens: جزء الموجّه الذي لا يُكتب في ذاكرة التخزين المؤقت ولا يُقرأ منها، ويُفوتر بسعر المدخلات الأساسي. في Claude Code يكون دائماً تقريباً حفنة من التوكنات، لأن كل شيء تقريباً يمر عبر ذاكرة التخزين المؤقت.cache_creation_input_tokens: جزء الموجّه المخزَّن في ذاكرة التخزين المؤقت ليعيد الطلب التالي استخدامه. الكتابة في ذاكرة التخزين المؤقت تكلّف 1.25 ضعف سعر المدخلات لذاكرة مدتها 5 دقائق، وضعفين لذاكرة مدتها ساعة. في سجلاتنا كانت 97% من الكتابات من نوع الساعة.cache_read_input_tokens: جزء الموجّه المُعاد تشغيله من ذاكرة التخزين المؤقت. القراءة من ذاكرة التخزين المؤقت تكلّف 0.1 من سعر المدخلات في معظم النماذج، و0.05 في Opus 5.5 وSonnet 5.5، و0.025 في Fable 5.1 (صفحة التخزين المؤقت للموجّهات لدى Anthropic، تم التحقق منها في 10 أكتوبر 2026).output_tokens: ما يكتبه Claude، بما فيه التفكير. المخرجات تكلّف 5 أضعاف سعر المدخلات في كل النماذج الحالية: 20 دولاراً للمليون في Opus 5.5، و25 في Opus 5، و50 في Fable 5.1، و10 في Sonnet 5.5.
مجموع العدّادات الثلاثة الأولى هو السياق الذي قرأه النموذج لهذا الطلب. والرابع هو الرد.
كيف تبدو 30 يوماً من جلساتنا
على الطلبات البالغة 19,668 طلباً، محتسبة مرة واحدة لكل طلب (قد يمتد استدعاء API واحد على عدة أسطر من السجل):
| العدّاد | التوكنات | الحصة من التوكنات | الحصة من التكلفة بأسعار API الرسمية |
|---|---|---|---|
| المدخلات (خارج ذاكرة التخزين المؤقت) | 114,411 | 0.003% | 0.04% |
| كتابات ذاكرة التخزين المؤقت | 74,834,070 | 2.0% | 37.4% |
| قراءات ذاكرة التخزين المؤقت | 3,710,054,709 | 97.7% | 45.7% |
| المخرجات | 12,727,193 | 0.34% | 16.8% |
| الإجمالي | 3,797,730,383 | 100% | 2,563 دولاراً |
عمود التكلفة يسعّر كل طلب بنموذجه الخاص ومدة ذاكرة التخزين المؤقت الخاصة به. نحن لا ندفع هذا المبلغ: هذه الجلسات كانت تعمل ضمن اشتراك. إنه وزن كل عدّاد، وهو الترجيح نفسه الذي يستخدمه AgentsRoom لتوزيع النسبة المئوية للاشتراك بين المشاريع.
ثلاث قراءات.
كل توكن تقريباً هو المحادثة تُعاد قراءتها. 97.7% من التوكنات قراءات من ذاكرة التخزين المؤقت. و99.2% من الطلبات تقرأ شيئاً منها. حين يقول أحدهم إن جلسة «استهلكت 50 مليون توكن»، فهذا ما ينظر إليه.
ما يكتبه Claude ضئيل بالتوكنات وليس ضئيلاً بالتكلفة. 0.34% من التوكنات، و16.8% من الفاتورة، لأن المخرجات أغلى توكن على الإطلاق. وشكّل التفكير 29% من تلك المخرجات.
كتابات ذاكرة التخزين المؤقت هي المفاجأة المكلفة. 2% من التوكنات، و37% من التكلفة. توقعنا أن تأتي من انتهاء صلاحية ذاكرة التخزين المؤقت، لكن 16 طلباً فقط من أصل 19,668 اضطرت إلى إعادة كتابة سياق بارد، سبعة منها بعد أكثر من ساعة من الصمت. 79% من الكتابات هي ببساطة كل رسالة جديدة وكل نتيجة أداة تُخزَّن مرة واحدة، بضعف سعر المدخلات، قبل أن تُعاد قراءتها في كل دورة لاحقة. والـ 20% الباقية هي الطلب الأول من كل جلسة.
لماذا تثقل الجلسة مع كل دورة
النموذج لا يحتفظ بشيء بين طلبين. يعيد Claude Code إرسال كل شيء في كل مرة: موجّه النظام، وتعريفات الأدوات، وCLAUDE.md، وكل رسالة، وكل ملف قرأه، وكل مخرجات أمر. ذاكرة التخزين المؤقت تجعل الجزء المتكرر رخيصاً لكل توكن، لا مجانياً، ولا أصغر.
السياق الوسيط المقروء لكل طلب، بحسب موقعه في الجلسة:
| الطلب في الجلسة | الطلبات | السياق الوسيط |
|---|---|---|
| الأول | 388 | 52,000 توكن |
| من الثاني إلى العاشر | 3,210 | 93,000 توكن |
| من 11 إلى 50 | 8,546 | 161,000 توكن |
| من 51 إلى 200 | 6,414 | 237,000 توكن |
| بعد الطلب 200 | 1,110 | 342,000 توكن |
قرأ الطلب الوسيط 179,000 توكن من السياق ليكتب 290 توكناً من الرد. هذه النسبة تختصر قصة التوكنات كلها في وكيل برمجة: الرد قصير، والقراءة طويلة، والقراءة تكبر مع الجلسة.
طلبنا الأول ثقيل، 52,000 توكن قبل أن يكتب أحد أي شيء، لأن وكلاءنا يبدأون بموجز دور طويل وأربعة خوادم MCP تقع تعريفات أدواتها في الموجّه. جلسة Claude Code مجرّدة في مجلد فارغ تبدأ عند رقم أقل بكثير. يعرض /context ما تحمله جلستك قبل الرسالة الأولى.
ما تستهلكه جلسة واحدة
على الجلسات البالغة 380 جلسة التي تضم ثلاثة طلبات على الأقل:
- 33 طلباً في الوسيط، ومن 16 إلى 61 للنصف الأوسط.
- 27,000 توكن من المخرجات في الوسيط، ومن 12,000 إلى 48,000.
- 5.4 مليون توكن معالجة في الوسيط، ومن 1.5 إلى 10.7 مليون للنصف الأوسط، منها 5.1 مليون قراءات من ذاكرة التخزين المؤقت.
- 181,000 توكن مكتوبة في ذاكرة التخزين المؤقت أو مرسلة خارجها في الوسيط: الجزء الجديد فعلاً.
- 4.55 دولار بأسعار API الرسمية في الوسيط، ومن 1.81 إلى 9.25 للنصف الأوسط.
إذن الجواب الصادق عن سؤال «كم توكناً تستهلك جلسة برمجة» هو نطاق يتراوح بين مليون وعشرة ملايين تقريباً، وكله تقريباً السياق نفسه يُقرأ من جديد. جلسة تعمل طوال فترة ما بعد الظهر على مهمة طويلة واحدة تقع في أعلى النطاق؛ وجلسة تصلح خطأً واحداً ثم تتوقف تقع في أسفله.
ما الذي تحتسبه فعلاً نافذة الخمس ساعات والأسبوع
في اشتراك Pro أو Max لا ترى أبداً رصيداً من التوكنات. يقول مركز مساعدة Anthropic إن لكلا الاشتراكين حداً للجلسة مدته خمس ساعات وحداً أسبوعياً، وإن هذه الحدود مشتركة بين Claude وClaude Code (بما في ذلك بيئة التطوير IDE)، وإن لاشتراكات Max حداً أسبوعياً منفصلاً لـ Fable. ولا ينشر أي رقم بالتوكنات لأي منها. يعرض /usage نسبة مئوية من كل نافذة، والوقت الذي يُعاد فيه ضبطها.
ما يحرّك هذه النسبة، بحسب قائمة Anthropic نفسها: طول الرسالة، وحجم المرفقات، وطول المحادثة الحالية، واستخدام الأدوات، واختيار النموذج، ومستوى الجهد، والمهام متعددة الخطوات. وبقراءتها مع الجداول أعلاه، فإن «طول المحادثة الحالية» هو العامل المهيمن في جلسة البرمجة: السياق المقروء في كل طلب ينمو من 52,000 إلى 237,000 توكن خلال خمسين طلباً. ويقول مركز المساعدة أيضاً إن المحتوى المخزَّن مؤقتاً في المشاريع يُحتسب أقل من حدودك عند إعادة استخدامه، وهي الفكرة نفسها التي يقوم عليها سعر القراءة من ذاكرة التخزين المؤقت.
لا نعرف كيف تحوّل Anthropic التوكنات إلى نسبة مئوية من النافذة، ولن نخترع معادلة تحويل. ما تقوله البيانات هو أن طلباً متأخراً في جلسة طويلة يُحتسب أضعاف ما يُحتسب به طلب مبكر، للسؤال نفسه.
ما الذي يغيّر العدد عملياً
أربع روافع، بترتيب أهميتها في بياناتنا:
/clearبين مهمتين لا علاقة بينهما. تصفه Anthropic بأنه «الرافعة الأكثر فاعلية على الإطلاق، للجودة وللتكلفة معاً». مهمة جديدة في جلسة قديمة تدفع ثمن سياق المهمة القديمة في كل طلب./compactحين تواصل جلسة طويلة. يستبدل السجل بملخص قصير، فتقرأ الطلبات التالية أقل.- انتبه لما يدخل السياق. قراءة ملف أو مخرجات أمر بحجم 20,000 توكن تُكتب مرة واحدة بضعف سعر المدخلات، ثم تُعاد قراءتها في كل طلب لاحق حتى نهاية الجلسة. قراءة الأسطر التي تحتاجها بدلاً من الملف كاملاً توفّر مرتين.
- النموذج والجهد. شكّل التفكير 29% من مخرجاتنا، والمخرجات أغلى توكن. مستوى جهد أدنى في العمل الروتيني يخفّض المخرجات، ونموذج أرخص يخفّض كل الأسعار دفعة واحدة.
ما لم يكن له وزن في بياناتنا: ترك الجلسة خاملة. مع ذاكرة التخزين المؤقت لمدة ساعة التي يستخدمها Claude Code في سجلاتنا، حدثت إعادة كتابة باردة 16 مرة في 30 يوماً.
لمزيد من طرق خفض الإنفاق، اقرأ كيف تخفّض تكاليف توكنات Claude Code.
أحصِ توكناتك
الجدول أعلاه ناتج عن سكربت بلا أي اعتمادية. يقرأ كل سجلات Claude Code على الجهاز، ويحتسب كل طلب مرة واحدة، ويطبع العدّادات الأربعة والقيم الوسيطة للجلسات. أضف مرشحاً على o["timestamp"] إن أردت نافذة زمنية.
import json, glob, os, statistics as st
from collections import defaultdict
FIELDS = ("input_tokens", "cache_creation_input_tokens",
"cache_read_input_tokens", "output_tokens")
totals, sessions = defaultdict(int), []
for path in glob.glob(os.path.expanduser("~/.claude/projects/*/*.jsonl")):
seen, session = set(), defaultdict(int)
with open(path, errors="ignore") as fh:
for line in fh:
try: o = json.loads(line)
except ValueError: continue
msg = o.get("message") or {}
usage = msg.get("usage") if isinstance(msg, dict) else None
if o.get("type") != "assistant" or not usage: continue
rid = o.get("requestId") or o.get("uuid")
if rid in seen: continue # one API call can span several lines
seen.add(rid)
session["requests"] += 1
for f in FIELDS:
n = usage.get(f) or 0
totals[f] += n
session[f] += n
if session["requests"] >= 3: sessions.append(session)
grand = sum(totals[f] for f in FIELDS)
for f in FIELDS:
print(f"{f:30s} {totals[f]:>15,} {100 * totals[f] / grand:6.2f}%")
for key in ("requests", "output_tokens", "cache_read_input_tokens"):
print(f"median per session, {key}: {st.median(s[key] for s in sessions):,.0f}")
قارن حصصك بحصصنا. سطر القراءات من ذاكرة التخزين المؤقت هو المحادثة تُعاد قراءتها، وسطر الكتابات هو ما كان جديداً: هذان السطران يقولان عن فاتورتك أكثر مما يقوله سطر المخرجات.
أين يعرض AgentsRoom ذلك
السكربت يعطيك شهراً. أثناء عملك، يعرض AgentsRoom العدّادات نفسها لكل وكيل: شارة توكنات في محرر الرسائل لكل جلسة تتحول إلى الأحمر حين تثقل الجلسة، ومراقب جلسة يعرض المدخلات والمخرجات وكتابات ذاكرة التخزين المؤقت وقراءاتها ونسبة الإصابة فيها، وأثر جلسة يعيد تشغيل الجلسة دورة بدورة ليبيّن أي قراءة ملف أو أي نتيجة أداة ملأت السياق. وتوزّع لوحة الاستخدام النسبة المئوية التي يعلنها اشتراكك بين مشاريعك ووكلائك، مع ترجيح كل جلسة بما كانت ستكلّفه بأسعار API، وهو الترجيح نفسه المستخدم في الجدول أعلاه.
ما لا يعطيك إياه أي من ذلك هو رصيد من التوكنات، لأن اشتراكك لا يملك رصيداً. لهذا السؤال، اقرأ كم عدد التوكنات المتبقية لك في Claude. ولمعرفة السرعة التي تصل بها توكنات المخرجات هذه، اقرأ توكنات Claude Code في الثانية، مقيسة.
الأسئلة الشائعة
ما هو التوكن في Claude؟
الوحدة التي يقرأ بها Claude النص ويكتبه: جزء من كلمة، وأحياناً كلمة قصيرة كاملة، وأحياناً حرف واحد أو بايت واحد. تقول Anthropic إن الحجم يتوقف على النموذج وعلى اللغة: في النماذج السابقة لـ Claude 4.7 كان التوكن يساوي نحو 3.5 حرف إنجليزي، أما Claude 4.7 وما بعده فتستخدم أداة تقسيم أحدث (tokenizer) تنتج نحو 30% من التوكنات الإضافية للنص نفسه. كل ما يفعله Claude يُقاس بالتوكنات: ما ترسله، وما يكتبه رداً عليك، وما يحتفظ به في ذاكرة التخزين المؤقت بين دورة وأخرى.
كم حرفاً أو كلمة يساوي توكن Claude؟
يتوقف ذلك على اللغة وعلى النص. تذكر Anthropic نحو 3.5 حرف إنجليزي لكل توكن في النماذج السابقة لـ Claude 4.7، ونحو 30% من التوكنات الإضافية للنص نفسه في Claude 4.7 وما بعده. وفي 296 رداً نصياً خالصاً كتبها وكلاؤنا بالفرنسية في سبتمبر وأكتوبر 2026، كان التوكن يساوي 2.3 حرف، أي نحو 2.6 توكن لكل كلمة. الكود وJSON والكتابات غير اللاتينية تعطي نسباً أخرى. وللحصول على عدد دقيق، تأخذ نقطة نهاية عدّ التوكنات لدى Anthropic النص والنموذج.
لماذا يستهلك Claude Code كل هذا العدد من التوكنات؟
لأن كل طلب يعيد إرسال المحادثة كاملة: موجّه النظام، وتعريفات الأدوات، وCLAUDE.md، وكل رسالة وكل نتيجة أداة حتى تلك اللحظة. في طلباتنا البالغة 19,668 طلباً، حمل الطلب الوسيط 179,000 توكن من السياق ليكتب 290 توكناً من الرد، ونما السياق من 52,000 توكن في أول طلب من الجلسة إلى 237,000 بعد خمسين طلباً. ذاكرة التخزين المؤقت تجعل إعادة القراءة هذه رخيصة لكل توكن، لكنها تُحتسب رغم ذلك.
كم توكناً تستهلك جلسة Claude Code نموذجية؟
في جلساتنا البالغة 380 جلسة من ثلاثة طلبات أو أكثر، المسجلة بين 10 سبتمبر و9 أكتوبر 2026: 33 طلباً في الوسيط، و27,000 توكن من المخرجات، و5.4 مليون توكن معالجة إجمالاً، منها 5.1 مليون قراءات من ذاكرة التخزين المؤقت. وقعت نصف الجلسات بين 1.5 و10.7 مليون توكن. بأسعار API الرسمية كانت هذه الجلسة الوسيطة ستكلّف نحو 4.55 دولار؛ أما في اشتراك Pro أو Max فيُخصم العمل نفسه من نافذة الخمس ساعات والنافذة الأسبوعية بدلاً من ذلك.
هل تُحتسب توكنات التفكير؟
نعم. توكنات التفكير جزء من output_tokens في كل كتلة usage، مع حقل thinking_tokens يبيّن كم من المخرجات كان تفكيراً. وهي تُفوتر بسعر المخرجات على API، وتضع Anthropic مستوى الجهد ضمن العوامل التي تجعل حدود استخدام الاشتراك تنفد أسرع. في مجموعة بياناتنا شكّل التفكير 29% من كل ما كتبته النماذج.
ما الفرق بين توكنات كتابة ذاكرة التخزين المؤقت وتوكنات قراءتها؟
الكتابة في ذاكرة التخزين المؤقت تخزّن جزءاً من الموجّه ليعيد الطلب التالي استخدامه، وتكلّف أكثر من المدخلات العادية: 1.25 ضعف سعر المدخلات لذاكرة تخزين مؤقت مدتها 5 دقائق، وضعفين لذاكرة مدتها ساعة. أما القراءة من ذاكرة التخزين المؤقت فتعيد استخدام ذلك الجزء المخزَّن وتكلّف أقل بكثير: 0.1 من سعر المدخلات في معظم النماذج، و0.05 في Opus 5.5 وSonnet 5.5، و0.025 في Fable 5.1. في جلساتنا شكّلت القراءات 98% من التوكنات و46% من التكلفة بالأسعار الرسمية؛ وشكّلت الكتابات 2% من التوكنات و37% من التكلفة.
تحميل AgentsRoom
شغّل كل وكلاء الذكاء الاصطناعي لديك، في كل مشاريعك، من نافذة واحدة.
التطبيق المرافق: تابع وكلاءك أينما كنت
استخدم Claude أو Codex أو Antigravity CLI أو أي مزود AI آخر.
أرسل الأخطاء والطلبات مباشرة إلى قائمة المهام العامة.
تابع القراءة
إبقاء Claude Code يعمل بعد انقطاع SSH: وصفة tmux
أبقِ Claude Code يعمل بعد انقطاع SSH باستخدام tmux. عُد إلى العملية نفسها، وتحقق من الاستمرارية، واستخدم الخيار الاختياري في AgentsRoom.
اقرأ المقالRoutines في Claude Code: ما الذي يعمل في السحابة، وما الذي يبقى على جهازك، وكيف تختار
Routines هي طريقة Claude Code لتشغيل موجّه محفوظ من دونك: وفق جدول، أو عند استدعاء API، أو عند حدث في GitHub، في cloud session تبدأ من نسخة مستنسخة جديدة من مستودعك. وهي في مرحلة research preview. ولدى Claude Code أيضاً طريقتان محليتان لجدولة العمل، المهام المجدولة في تطبيق سطح المكتب و/loop، والثلاث لا تتصرف بالطريقة نفسها: الفاصل الزمني الأدنى، والوصول إلى ملفاتك المحلية، وطلبات الإذن، وما يحدث حين يدخل الحاسوب المحمول في وضع السكون. يعرض هذا الدليل الثلاث مع الحدود الواردة في الوثائق، ثم يشرح لماذا يعمل وكلاؤنا الليليون السبعة على جهاز محلي بدلاً منها.
اقرأ المقالسبعة وكلاء ذكاء اصطناعي يديرون ليالينا: وكلاء مجدولون أبعد من البرمجة، مع البرومبتات
سألنا أحد المستخدمين كيف نستعمل وكلاء الذكاء الاصطناعي في شيء آخر غير كتابة الكود. منذ 28 أغسطس، ينطلق سبعة وكلاء مجدولين كل مساء على Mac mini: CEO مناوب، وفريق SEO، ومدير منتج، ومُصلِح أخطاء، وفريق للشبكات الاجتماعية، وأمين للتوثيق، ومُعِدّ تقرير يرسل بريدًا إلكترونيًا من 25 سطرًا. 33 ليلة، و31 بريدًا صباحيًا، و51 خطأ مُصلَحًا مع رابط الـ commit، و7 مقالات مدونة بـ 20 لغة. ما يفعله كل واحد منهم، وكيف يتبادلون العمل دون أن يتحدثوا، وأي نموذج يؤدي أي مهنة، والقواعد الأربع التي اضطرت البرومبتات إلى تعلّمها، والبرومبتات نفسها، جاهزة للنسخ.
اقرأ المقال