Tôi còn bao nhiêu token trong Claude? Hai màn hình cần kiểm tra.
Gói đăng ký Claude của bạn không được tính bằng token, nên không màn hình nào hiển thị số dư token. Đây là thứ nó thực sự đo, hai màn hình thực sự hiển thị nó, lý do nó vẫn hao đi trong lúc bạn không gõ gì, và thay đổi về khung thời gian hàng tuần tháng 9 năm 2026 tác động thế nào đến tuần làm việc của bạn.
Đây là một trong những câu hỏi được tìm kiếm nhiều nhất về Claude, và nó được đặt ra trong gần như mọi ngôn ngữ. Nó cũng có một câu trả lời khó chịu: không hề có con số đó, vì gói đăng ký của bạn không được bán theo token.
Đó không phải là một chi tiết kỹ thuật vụn vặt. Nó giải thích vì sao bạn không tìm thấy bộ đếm mà bạn đang tìm, vì sao mọi trang tự nhận là hiển thị được nó đều đang phỏng đoán, và vì sao thứ thực sự chặn bạn giữa chừng một tác vụ lại không phải là thứ mà phần lớn mọi người đang theo dõi.
Gói đăng ký của bạn được đo bằng khung thời gian, không phải bằng token
Anthropic không diễn đạt gói đăng ký Claude dưới dạng hạn mức token. Họ đo nó bằng các khung thời gian sử dụng: một khung thời gian phiên trượt theo thời gian, và một khung thời gian hàng tuần nằm bên trên nó. Cả hai đều được dùng chung trên mọi bề mặt mà bạn đăng nhập vào, nên một buổi chiều dài trong Claude chat sẽ để lại ít chỗ hơn cho Claude Code vào buổi tối. Cả hai cũng được dùng chung giữa các mô hình, đó là lý do chuyển sang một mô hình rẻ hơn bằng /model không trả lại giới hạn cho bạn một khi bạn đã chạm vào nó.
Vì vậy thứ bạn đọc được là tỷ lệ của một khung thời gian và thời điểm nó quay trở lại, chứ không phải một số dư. Khi bạn thực sự hết, thông báo chặn bạn sẽ cho biết bạn đã chạm trần nào và khi nào nó được đặt lại, và thông báo đó là con số chính thức duy nhất cho tài khoản của bạn.
Nơi duy nhất mà một số đếm token mang nghĩa đen là API, vốn được tính tiền theo từng token. Mọi thứ bên dưới đều nói về gói đăng ký, thứ mà phần lớn mọi người thực sự muốn hỏi.
Khung thời gian hàng tuần không phải là thứ bất biến
Điều không ai tính trước là khung thời gian hàng tuần có thể bị thay đổi kích thước, và nó không giữ nguyên được lâu.
Từ tháng 5 năm 2026, hạn mức hàng tuần vẫn kèm theo một khoản cộng thêm tạm thời 50%, đã được gia hạn ba lần. Khoản đó kéo dài đến ngày 14 tháng 9 năm 2026, và kể từ ngày đó một khoản cộng thêm vĩnh viễn 25% so với mức nền trước khi có khoản cộng thêm sẽ thay thế nó. So với mức nền ban đầu ấy, đây là một mức tăng. So với những gì tài khoản của bạn thực sự đang có trong tuần này, đây là một mức cắt giảm 17%: một tuần đáng giá 150 trở thành một tuần đáng giá 125. Khung thời gian phiên trượt thì không đổi, nên chênh lệch chỉ lộ ra ở những tuần đủ nặng để chạm trần hàng tuần, tức đúng những tuần mà bạn cảm nhận được nó rõ nhất.
Đơn vị của cái trần đó cũng không phải token. Nó được đếm bằng giờ tính toán hoạt động, thứ chỉ chạy trong lúc một lượt đang được xử lý chứ không phải trong lúc bạn ngồi đọc kết quả, và Claude Code, claude.ai và Cowork đều rút từ cùng một nguồn. Một buổi chiều với ba subagent cùng chạy sẽ ngốn hết hạn mức cả tuần nhanh hơn nhiều so với những gì số tin nhắn bạn gửi cho thấy.
Một phiên đầy đủ 5 giờ thực sự tốn bao nhiêu phần của tuần đó thì cũng không được công bố. Robin Hood đo điều đó trên các gói đăng ký thật, theo từng nhà cung cấp và từng gói, và báo hiệu ngày một nhà cung cấp thay đổi giới hạn.
Con số bạn đọc được, và nơi nó nằm
Có hai màn hình, và chúng trả lời những câu hỏi khác nhau.
Bên trong Claude Code, /usage là thứ đáng học. Trên gói Pro, Max, Team hoặc Enterprise, nó hiển thị các thanh mức sử dụng cho những giới hạn của gói, và bạn nhấn d hoặc w để chuyển giữa 24 giờ gần nhất và 7 ngày gần nhất. Bên dưới các thanh đó, nó làm một việc hữu ích hơn bất kỳ con số thô nào: nó phân bổ mức sử dụng gần đây cho từng skill, subagent, plugin và từng máy chủ MCP riêng lẻ, mỗi thứ dưới dạng phần trăm, và nêu một cảnh báo hành vi khi một kiểu sử dụng chiếm từ 10% trở lên lượng tiêu thụ gần đây của bạn, chẳng hạn ngữ cảnh quá dài hoặc trượt cache.
Có một điểm cần lưu ý và rất dễ bỏ sót: các con số đó được tính từ lịch sử phiên cục bộ trên chính máy đó. Công việc thực hiện từ một máy tính xách tay khác, hoặc trên claude.ai, không nằm trong đó.
Trên web, Settings rồi Usage tại claude.ai là góc nhìn ở cấp tài khoản: gói của bạn, bạn đang đứng ở đâu, và khi nào khung thời gian hàng tuần được đặt lại. Nếu bạn làm việc trên hai máy, đây mới là góc nhìn đầy đủ.
Để có bảng phân tích theo từng phiên về chi phí thực sự của một phần công việc, khối trên cùng của /usage in ra các số đếm thô:
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write
Bốn con số đó là toàn bộ câu chuyện của một phiên lập trình, và con số lớn nhất gần như luôn là cache read. Nếu bạn muốn thấy góc nhìn đó liên tục thay vì phải gọi ra từng lần, AgentsRoom giữ một đồng hồ token trực tiếp trên mọi phiên ngay cạnh terminal, với cùng cách tách input, output và cache, kèm một huy hiệu đỏ khi một phiên bắt đầu nóng lên. Phiên bản từng bước về cách đọc bộ đếm của chính CLI được trình bày trong cách kiểm tra mức sử dụng token Claude Code.
/usage phân bổ những gì bạn đã tiêu cho các skill, subagent, plugin và máy chủ MCP, nhưng không bao giờ cho một dự án hay một agent lập trình. AgentsRoom bổ sung phần chia đó: nó lấy chính phần trăm mà nhà cung cấp của bạn công bố rồi chia ra giữa các dự án và các agent của bạn, tính trọng số cho mỗi phiên theo chi phí mà phiên đó sẽ tốn ở mức giá API.

Hãy đọc nó như một ước tính, không phải như một hóa đơn. Chỉ công việc mà máy này nhìn thấy mới nằm trong mẫu số, nên bất cứ thứ gì bạn làm trên một máy tính xách tay khác hoặc trên web đều bị thiếu, và mọi tỷ lệ đều ra cao hơn thực tế một chút.
Token thực sự là gì khi đã có một agent tham gia
Token là một mảnh văn bản: khoảng ba phần tư một từ trong tiếng Anh, và ít hơn đáng kể trong mã nguồn, nơi dấu câu và định danh bị cắt vụn rất dễ dàng.
Phần khiến mọi người bất ngờ là toàn bộ cuộc trò chuyện được gửi lại đầy đủ ở mỗi yêu cầu. Hãy đặt một câu hỏi dài một dòng trong phiên đã mở từ sáng, và bạn không trả tiền cho dòng đó, bạn trả tiền cho toàn bộ lịch sử đi kèm với nó. Mỗi lần agent dùng một công cụ, nó lại gửi thêm một yêu cầu nữa, mang theo các kết quả công cụ trước đó, đó là lý do một câu "sửa cái test này" có thể biến thành cả chục lượt đi về.
Prompt caching là thứ khiến điều này còn chịu đựng được. Phần lịch sử lặp lại được tính ở mức giá cache thấp hơn nhiều, đó là lý do con số cache read thì khổng lồ còn hóa đơn thì không. Nó cũng tạo ra thói quen tốn kém nhất trong công việc với agent, chính là chủ đề của phần tiếp theo.
Vì sao thanh mức sử dụng vẫn nhích lên trong lúc bạn không gõ gì
Nếu mức sử dụng của bạn tăng lên trên một phiên đang nhàn rỗi, thì đó là một trong những nguyên nhân sau, và không cái nào là lỗi cả:
- Cache hết hạn. Ngữ cảnh được cache sống khoảng một giờ trên gói đăng ký, và rút xuống còn năm phút khi bạn bắt đầu dùng đến usage credits, hoặc khi dùng một API key. Đi ăn trưa về, tin nhắn đầu tiên của bạn trượt cache: toàn bộ cuộc trò chuyện được xử lý lại ở giá đầy đủ. Một lần tạm dừng, một lần xử lý lại toàn bộ.
- Bất cứ thứ gì tự nó khởi động một lượt. Một tác vụ hẹn giờ chạy đến hạn, một tin nhắn đến từ một phiên khác của bạn, một lần điểm danh mục tiêu trong khi công việc nền đang chạy. Mỗi thứ đều gửi lại toàn bộ ngữ cảnh, y hệt một tin nhắn do bạn gõ.
- Các agent đồng đội. Mỗi đồng đội đang hoạt động chạy cửa sổ ngữ cảnh riêng của nó và tiếp tục tiêu thụ cho đến khi thoát. Chính hướng dẫn của Anthropic ước tính một đội ở chế độ plan tiêu tốn khoảng bảy lần một phiên tiêu chuẩn.
- Việc nén ngữ cảnh.
/compactphải đọc cuộc trò chuyện mà nó tóm tắt, nên nén một ngữ cảnh lớn tự nó đã là một yêu cầu lớn./clearkhông tốn gì cả, và khi bạn không cần giữ mạch liên tục thì đó là lựa chọn tốt hơn. - Công việc chạy nền. Các bản tóm tắt phục vụ
--resumevà những việc vặt tương tự vẫn tiêu một lượng nhỏ ngay cả khi bạn đang nhàn rỗi, thường dưới bốn xu mỗi phiên.
Đây cũng là chỗ hai loại cảnh báo mà mọi người hay nhầm lẫn tách hẳn khỏi nhau. Một cảnh báo về ngữ cảnh hoặc auto-compact nói rằng một cuộc trò chuyện đang tiến gần cửa sổ ngữ cảnh của mô hình, và chạy /clear cho phiên đó là xong. Một giới hạn sử dụng nói rằng hạn mức bao gồm trong gói của bạn đã tiêu hết trên toàn bộ các phiên, và việc chạy /clear không trả lại chút nào. Dấu hiệu đáng tin: giới hạn sử dụng có nêu một thời điểm đặt lại, còn cảnh báo ngữ cảnh thì không.
Cần làm gì khi thanh mức sử dụng gần đầy
Xếp theo thứ tự tương đối về hiệu quả thu được so với công sức bỏ ra:
- Chạy
/cleargiữa những tác vụ không liên quan. Ngữ cảnh cũ kỹ sẽ được gửi lại ở mỗi tin nhắn cho đến hết phiên. Hãy dùng/renametrước/clearnếu bạn muốn tìm lại nó sau này bằng/resume. - Chọn mô hình phù hợp với công việc. Sonnet xử lý được phần lớn việc lập trình; để Opus làm mặc định là nguyên nhân phổ biến nhất khiến hạn mức bốc hơi ngay từ thứ Năm.
- Đọc phần phân bổ trong
/usage. Nếu một máy chủ MCP hoặc một subagent chiếm 30% cả tuần của bạn, đó chính là chỗ cần sửa, và bạn sẽ chẳng bao giờ đoán ra được là cái nào. - Hãy hạ mức suy luận xuống trước khi tắt hẳn nó. Token suy luận được tính tiền như output. Hạ mức độ nỗ lực suy luận của mô hình thường là đủ.
- Đẩy những việc sinh ra nhiều chữ vào subagent. Kết quả chạy test và các tệp log nằm lại trong ngữ cảnh của subagent, chỉ một bản tóm tắt được trả về.
- Giữ tệp ngữ cảnh ngắn gọn. Mọi thứ nằm trong
CLAUDE.mdhayAGENTS.mdđều được nạp lúc bắt đầu phiên và bị tính tiền ở mỗi lượt, kể cả khi nó chẳng liên quan gì. Những hướng dẫn quy trình dài nên nằm trong một skill, thứ chỉ được nạp khi được gọi. Có thêm chi tiết về điều đó trong hướng dẫn về tệp ngữ cảnh AGENTS.md.
Nếu bạn muốn bản dài hơn dành riêng cho khía cạnh cắt giảm chi phí, giảm chi phí token Claude Code đi qua từng điểm một cách chi tiết.
Cả sáu cách đó đều giả định rằng bạn đã nhận ra kịp lúc, mà thanh mức sử dụng chỉ hiện ra khi bạn gọi nó. Nếu bạn muốn được báo thay vì phải tự xem, AgentsRoom gửi một cảnh báo mức sử dụng đến máy tính hoặc điện thoại của bạn khi một thanh vượt 50% rồi 75% theo mặc định, hoặc một ngưỡng bạn tự chọn cho từng thanh, mỗi khung thời gian một lần. Danh sách ở trên chỉ thay đổi được điều gì đó khi tuần này vẫn còn phần để cứu.
Những gì còn tác dụng khi khung thời gian đã cạn
Mọi cách ở phần trước đều mang tính phòng ngừa: chúng thay đổi tốc độ bạn tiến đến cái trần, và không cách nào trả lại được gì một khi bạn đã vượt qua nó. Chờ đến lúc đặt lại là lựa chọn mặc định, và thông báo giới hạn là nơi duy nhất cho bạn biết lúc đó là khi nào. Có ba thứ rút ngắn được thời gian chờ.
Một tài khoản thứ hai. Một khung thời gian thuộc về tài khoản chứ không thuộc về máy, nên một tài khoản bạn chưa tiêu đến vẫn còn nguyên khung của riêng nó. Cái khó là Claude Code chỉ giữ một phiên đăng nhập tại một thời điểm; dùng nhiều tài khoản Claude Code trên cùng một máy trình bày cơ chế của việc đó. AgentsRoom tự động hóa phần bàn giao: khi một tài khoản chạm trần, cuộc trò chuyện đang chạy sẽ chuyển sang một tài khoản khác mà bạn đã đăng nhập và đi tiếp từ chỗ nó dừng lại, thay vì phải bắt đầu lại ở nơi khác.
Một nhà cung cấp khác. Khung thời gian hàng tuần là của Anthropic, không phải của cả ngành. Nếu bạn cũng có quyền truy cập Codex, Antigravity hay Copilot, phần việc không nhất thiết phải cần đến Claude có thể chuyển sang đó cho hết tuần, và chạy nhiều nhà cung cấp song song là cách làm điều đó mà không phải trả giá bằng phần ngữ cảnh bạn đã tích lũy.
Mô hình rẻ hơn, dùng trước khi chạm trần chứ không phải sau đó. Chuyển bằng /model không trả lại gì một khi khung thời gian đã cạn, nhưng nó kéo dài được cái khung bạn đang ở trong. Đây là cách duy nhất trong ba cách không tốn công thiết lập, và cũng là lý do việc để mặc định ở Opus vẫn là nguyên nhân phổ biến nhất khiến bạn mất trắng một ngày thứ Năm.
Tóm lại trong vài dòng
Hãy thôi tìm một số dư token: gói của bạn không có cái đó. Hãy học thuộc hai khung thời gian, đọc /usage để xem phần phân bổ chứ không phải để lấy một tổng số, và coi cache là thứ quyết định cả tuần của bạn. Những lập trình viên không bao giờ chạm giới hạn hiếm khi là những người gõ ít hơn. Họ là những người mở một phiên mới khi chủ đề thay đổi.
Chạy nhiều agent cùng lúc làm cho tất cả những điều này vừa tệ hơn vừa dễ nhìn ra hơn, vì mức tiêu thụ thôi không còn là một con số duy nhất mà trở thành một con số cho mỗi agent. Đó chính là góc nhìn mà AgentsRoom được xây dựng xoay quanh.
Câu hỏi thường gặp
Tôi còn bao nhiêu token trong Claude?
Không hề có con số nào như vậy để tra cứu. Gói đăng ký Claude không được bán dưới dạng ngân sách token: nó được đo bằng tỷ lệ của một khung thời gian phiên trượt cộng với một khung thời gian hàng tuần, và thứ bạn đọc được là phần trăm của các khung đó cùng thời điểm chúng được đặt lại, chứ không phải một số dư token. Nơi để đọc nó là lệnh /usage bên trong Claude Code, hoặc Settings rồi Usage trên claude.ai. Chỉ trên API, vốn tính tiền theo từng token, một con số token mới có ý nghĩa.
Token của Claude hoạt động như thế nào?
Token là một mảnh văn bản, khoảng ba phần tư một từ trong tiếng Anh và ít hơn thế trong mã nguồn. Mỗi yêu cầu đều gửi lại toàn bộ cuộc trò chuyện của bạn, nên một phiên lập trình phải trả tiền cho phần lịch sử đã tích lũy ở mỗi lượt, chứ không chỉ cho câu bạn vừa gõ. Đó là lý do mức sử dụng được đếm bằng bốn con số riêng biệt: input, output, ghi cache và đọc cache. Phần lịch sử đã được cache bị tính ở mức giá thấp hơn nhiều so với input mới, và đó chính là lý do một phiên để mở suốt cả ngày vẫn hao vào gói của bạn.
Khi nào mức sử dụng Claude của tôi được đặt lại?
Có hai chiếc đồng hồ và chúng độc lập với nhau. Khung thời gian phiên trượt theo thời gian, nên nó hết hạn sau một số giờ cố định kể từ lúc mở chứ không phải vào một thời điểm bạn chọn. Khung thời gian hàng tuần nằm bên trên nó và được đặt lại vào một thời điểm cố định gán cho tài khoản của bạn. Chính thông báo giới hạn cho bạn biết khi nào khung đã chặn bạn sẽ quay trở lại, và thông báo đó là câu trả lời chính thức cho tài khoản của bạn. Hai chiếc đồng hồ này dùng chung giữa Claude chat và Claude Code, nên dùng chat nhiều sẽ rút ngắn ngân sách lập trình của bạn.
Chuyển sang mô hình rẻ hơn có trả lại giới hạn cho tôi không?
Không. Khung thời gian phiên và khung thời gian hàng tuần được dùng chung giữa các mô hình, nên chuyển bằng /model không khôi phục quyền truy cập một khi bạn đã chạm vào chúng. Nó có ích trong một trường hợp cụ thể: một thông báo gắn riêng với một mô hình, chẳng hạn khi bạn chạm giới hạn Opus, lúc đó chuyển sang Sonnet cho phép bạn tiếp tục làm việc. Nó cũng có ích trước khi bạn hết, vì một mô hình rẻ hơn tiêu ít hơn từ cùng hạn mức đó cho cùng khối lượng công việc.
Vì sao mức sử dụng của tôi tăng lên khi tôi không làm gì cả?
Vì trong một phiên chạy agent, sự nhàn rỗi không hề miễn phí. Bất cứ thứ gì khởi động một lượt đều gửi lại toàn bộ ngữ cảnh của bạn: một tác vụ hẹn giờ chạy đến hạn, một tin nhắn đến từ phiên khác, một agent đồng đội vẫn đang chạy, một lần điểm danh mục tiêu. Còn hai thứ nữa tốn token mà không cần đến một lượt nào: việc nén ngữ cảnh, vốn phải đọc cuộc trò chuyện mà nó tóm tắt, và tin nhắn đầu tiên sau một quãng nghỉ dài, vốn trượt prompt cache và xử lý lại toàn bộ lịch sử của bạn ở giá đầy đủ.
Claude Code có cắt giảm giới hạn hàng tuần vào tháng 9 năm 2026 không?
Khoản cộng thêm tạm thời 50% cho khung thời gian hàng tuần kéo dài đến ngày 14 tháng 9 năm 2026, và kể từ ngày đó một khoản cộng thêm vĩnh viễn 25% so với mức nền trước khi có khoản cộng thêm sẽ thay thế nó. Đo theo mức nền ban đầu ấy thì đây là một mức tăng, nhưng đo theo những gì một người dùng Claude Code đang có hôm nay thì đây là một mức giảm 17%: một tuần đáng giá 150 trở thành một tuần đáng giá 125. Khung thời gian phiên trượt không đổi, nên chênh lệch chỉ lộ ra ở những tuần đủ nặng để chạm trần hàng tuần.
Cảnh báo ngữ cảnh có phải là giới hạn sử dụng không?
Không, và nhầm lẫn hai thứ này khiến người ta chọn sai cách khắc phục. Cảnh báo về ngữ cảnh hoặc auto-compact nói về một cuộc trò chuyện đang tiến gần cửa sổ ngữ cảnh của mô hình, và nó được giải quyết bằng cách chạy /clear hoặc nén phiên đó lại. Giới hạn sử dụng nói về hạn mức bao gồm trong gói của bạn trên toàn bộ các phiên, và việc chạy /clear không trả lại chút nào. Dấu hiệu nằm ở cách diễn đạt: thông báo giới hạn có nêu một thời điểm đặt lại, còn cảnh báo ngữ cảnh thì không.
Tải AgentsRoom
Chạy tất cả agent AI của bạn, trên mọi dự án, trong một cửa sổ duy nhất.
Ứng dụng đồng hành: theo dõi agent khi đi đường
Sử dụng Claude, Codex, Antigravity CLI hoặc nhà cung cấp AI khác.
Gửi lỗi và yêu cầu thẳng vào backlog công khai của bạn.
Đọc thêm
Claude Code nhanh đến mức nào? Số token mỗi giây, đo trên 20.000 lượt
Claude Code không bao giờ hiển thị tốc độ đầu ra, nhưng bản ghi của mỗi phiên đều chứa đủ dữ liệu để tính. Chúng tôi chạy một script 40 dòng trên 319 phiên của chính mình, 20.408 lượt và 12 triệu token đầu ra: Opus 5 truyền ra với trung vị 63 token mỗi giây, Opus 5.5 ở mức 95, Sonnet 5 ở mức 77, và một câu trả lời ngắn luôn chậm hơn một câu trả lời dài. Phương pháp, script, số liệu, và những gì chế độ nhanh (fast mode) thay đổi.
Đọc bài viếtMười agent chạy cùng một lệnh typecheck một lúc. Lời giải là một thư mục.
Mười bảy agent lập trình trong cùng một checkout, mười tiến trình tsc cùng lúc, load average 37 và 87 MB RAM trống. Một lần typecheck chín mươi giây mất 7 phút 36. Đây là số đo thực tế, lý do máy không hề tính toán, và cái khóa dùng chung nhỏ xíu đã xử lý xong chuyện đó. Chép được vào bất kỳ kho mã nào.
Đọc bài viếtCode giờ do agent viết. Đây là những gì nghề lập trình viên đã trở thành.
Viết code chỉ là một mắt xích trong chuỗi sáu mắt xích, và đó đúng là mắt xích agent đã lấy đi. Năm mắt xích còn lại nặng thêm. Đây là phần nghề còn lại: nghe xem cần xây gì, quyết định, ra đề bài, điều phối, duyệt và phát hành.
Đọc bài viết