Tôi còn bao nhiêu token trong Claude? Không hề có con số đó.
Gói đăng ký Claude của bạn không được tính bằng token, nên không màn hình nào hiển thị số dư token. Đây là thứ nó thực sự đo, nơi để đọc nó, và lý do nó vẫn hao đi trong lúc bạn không gõ gì.
Đây là một trong những câu hỏi được tìm kiếm nhiều nhất về Claude, và nó được đặt ra trong gần như mọi ngôn ngữ. Nó cũng có một câu trả lời khó chịu: không hề có con số đó, vì gói đăng ký của bạn không được bán theo token.
Đó không phải là một chi tiết kỹ thuật vụn vặt. Nó giải thích vì sao bạn không tìm thấy bộ đếm mà bạn đang tìm, vì sao mọi trang tự nhận là hiển thị được nó đều đang phỏng đoán, và vì sao thứ thực sự chặn bạn giữa chừng một tác vụ lại không phải là thứ mà phần lớn mọi người đang theo dõi.
Gói đăng ký của bạn được đo bằng khung thời gian, không phải bằng token
Anthropic không diễn đạt gói đăng ký Claude dưới dạng hạn mức token. Họ đo nó bằng các khung thời gian sử dụng: một khung thời gian phiên trượt theo thời gian, và một khung thời gian hàng tuần nằm bên trên nó. Cả hai đều được dùng chung trên mọi bề mặt mà bạn đăng nhập vào, nên một buổi chiều dài trong Claude chat sẽ để lại ít chỗ hơn cho Claude Code vào buổi tối. Cả hai cũng được dùng chung giữa các mô hình, đó là lý do chuyển sang một mô hình rẻ hơn bằng /model không trả lại giới hạn cho bạn một khi bạn đã chạm vào nó.
Vì vậy thứ bạn đọc được là tỷ lệ của một khung thời gian và thời điểm nó quay trở lại, chứ không phải một số dư. Khi bạn thực sự hết, thông báo chặn bạn sẽ cho biết bạn đã chạm trần nào và khi nào nó được đặt lại, và thông báo đó là con số chính thức duy nhất cho tài khoản của bạn.
Nơi duy nhất mà một số đếm token mang nghĩa đen là API, vốn được tính tiền theo từng token. Mọi thứ bên dưới đều nói về gói đăng ký, thứ mà phần lớn mọi người thực sự muốn hỏi.
Con số bạn đọc được, và nơi nó nằm
Có hai màn hình, và chúng trả lời những câu hỏi khác nhau.
Bên trong Claude Code, /usage là thứ đáng học. Trên gói Pro, Max, Team hoặc Enterprise, nó hiển thị các thanh mức sử dụng cho những giới hạn của gói, và bạn nhấn d hoặc w để chuyển giữa 24 giờ gần nhất và 7 ngày gần nhất. Bên dưới các thanh đó, nó làm một việc hữu ích hơn bất kỳ con số thô nào: nó phân bổ mức sử dụng gần đây cho từng skill, subagent, plugin và từng máy chủ MCP riêng lẻ, mỗi thứ dưới dạng phần trăm, và nêu một cảnh báo hành vi khi một kiểu sử dụng chiếm từ 10% trở lên lượng tiêu thụ gần đây của bạn, chẳng hạn ngữ cảnh quá dài hoặc trượt cache.
Có một điểm cần lưu ý và rất dễ bỏ sót: các con số đó được tính từ lịch sử phiên cục bộ trên chính máy đó. Công việc thực hiện từ một máy tính xách tay khác, hoặc trên claude.ai, không nằm trong đó.
Trên web, Settings rồi Usage tại claude.ai là góc nhìn ở cấp tài khoản: gói của bạn, bạn đang đứng ở đâu, và khi nào khung thời gian hàng tuần được đặt lại. Nếu bạn làm việc trên hai máy, đây mới là góc nhìn đầy đủ.
Để có bảng phân tích theo từng phiên về chi phí thực sự của một phần công việc, khối trên cùng của /usage in ra các số đếm thô:
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write
Bốn con số đó là toàn bộ câu chuyện của một phiên lập trình, và con số lớn nhất gần như luôn là cache read. Nếu bạn muốn thấy góc nhìn đó liên tục thay vì phải gọi ra từng lần, AgentsRoom giữ một đồng hồ token trực tiếp trên mọi phiên ngay cạnh terminal, với cùng cách tách input, output và cache, kèm một huy hiệu đỏ khi một phiên bắt đầu nóng lên. Phiên bản từng bước về cách đọc bộ đếm của chính CLI được trình bày trong cách kiểm tra mức sử dụng token Claude Code.
Token thực sự là gì khi đã có một agent tham gia
Token là một mảnh văn bản: khoảng ba phần tư một từ trong tiếng Anh, và ít hơn đáng kể trong mã nguồn, nơi dấu câu và định danh bị cắt vụn rất dễ dàng.
Phần khiến mọi người bất ngờ là toàn bộ cuộc trò chuyện được gửi lại đầy đủ ở mỗi yêu cầu. Hãy đặt một câu hỏi dài một dòng trong phiên đã mở từ sáng, và bạn không trả tiền cho dòng đó, bạn trả tiền cho toàn bộ lịch sử đi kèm với nó. Mỗi lần agent dùng một công cụ, nó lại gửi thêm một yêu cầu nữa, mang theo các kết quả công cụ trước đó, đó là lý do một câu "sửa cái test này" có thể biến thành cả chục lượt đi về.
Prompt caching là thứ khiến điều này còn chịu đựng được. Phần lịch sử lặp lại được tính ở mức giá cache thấp hơn nhiều, đó là lý do con số cache read thì khổng lồ còn hóa đơn thì không. Nó cũng tạo ra thói quen tốn kém nhất trong công việc với agent, chính là chủ đề của phần tiếp theo.
Vì sao thanh mức sử dụng vẫn nhích lên trong lúc bạn không gõ gì
Nếu mức sử dụng của bạn tăng lên trên một phiên đang nhàn rỗi, thì đó là một trong những nguyên nhân sau, và không cái nào là lỗi cả:
- Cache hết hạn. Ngữ cảnh được cache sống khoảng một giờ trên gói đăng ký, và rút xuống còn năm phút khi bạn bắt đầu dùng đến usage credits, hoặc khi dùng một API key. Đi ăn trưa về, tin nhắn đầu tiên của bạn trượt cache: toàn bộ cuộc trò chuyện được xử lý lại ở giá đầy đủ. Một lần tạm dừng, một lần xử lý lại toàn bộ.
- Bất cứ thứ gì tự nó khởi động một lượt. Một tác vụ hẹn giờ chạy đến hạn, một tin nhắn đến từ một phiên khác của bạn, một lần điểm danh mục tiêu trong khi công việc nền đang chạy. Mỗi thứ đều gửi lại toàn bộ ngữ cảnh, y hệt một tin nhắn do bạn gõ.
- Các agent đồng đội. Mỗi đồng đội đang hoạt động chạy cửa sổ ngữ cảnh riêng của nó và tiếp tục tiêu thụ cho đến khi thoát. Chính hướng dẫn của Anthropic ước tính một đội ở chế độ plan tiêu tốn khoảng bảy lần một phiên tiêu chuẩn.
- Việc nén ngữ cảnh.
/compactphải đọc cuộc trò chuyện mà nó tóm tắt, nên nén một ngữ cảnh lớn tự nó đã là một yêu cầu lớn./clearkhông tốn gì cả, và khi bạn không cần giữ mạch liên tục thì đó là lựa chọn tốt hơn. - Công việc chạy nền. Các bản tóm tắt phục vụ
--resumevà những việc vặt tương tự vẫn tiêu một lượng nhỏ ngay cả khi bạn đang nhàn rỗi, thường dưới bốn xu mỗi phiên.
Đây cũng là chỗ hai loại cảnh báo mà mọi người hay nhầm lẫn tách hẳn khỏi nhau. Một cảnh báo về ngữ cảnh hoặc auto-compact nói rằng một cuộc trò chuyện đang tiến gần cửa sổ ngữ cảnh của mô hình, và chạy /clear cho phiên đó là xong. Một giới hạn sử dụng nói rằng hạn mức bao gồm trong gói của bạn đã tiêu hết trên toàn bộ các phiên, và việc chạy /clear không trả lại chút nào. Dấu hiệu đáng tin: giới hạn sử dụng có nêu một thời điểm đặt lại, còn cảnh báo ngữ cảnh thì không.
Cần làm gì khi thanh mức sử dụng gần đầy
Xếp theo thứ tự tương đối về hiệu quả thu được so với công sức bỏ ra:
- Chạy
/cleargiữa những tác vụ không liên quan. Ngữ cảnh cũ kỹ sẽ được gửi lại ở mỗi tin nhắn cho đến hết phiên. Hãy dùng/renametrước/clearnếu bạn muốn tìm lại nó sau này bằng/resume. - Chọn mô hình phù hợp với công việc. Sonnet xử lý được phần lớn việc lập trình; để Opus làm mặc định là nguyên nhân phổ biến nhất khiến hạn mức bốc hơi ngay từ thứ Năm.
- Đọc phần phân bổ trong
/usage. Nếu một máy chủ MCP hoặc một subagent chiếm 30% cả tuần của bạn, đó chính là chỗ cần sửa, và bạn sẽ chẳng bao giờ đoán ra được là cái nào. - Hãy hạ mức suy luận xuống trước khi tắt hẳn nó. Token suy luận được tính tiền như output. Hạ mức độ nỗ lực suy luận của mô hình thường là đủ.
- Đẩy những việc sinh ra nhiều chữ vào subagent. Kết quả chạy test và các tệp log nằm lại trong ngữ cảnh của subagent, chỉ một bản tóm tắt được trả về.
- Giữ tệp ngữ cảnh ngắn gọn. Mọi thứ nằm trong
CLAUDE.mdhayAGENTS.mdđều được nạp lúc bắt đầu phiên và bị tính tiền ở mỗi lượt, kể cả khi nó chẳng liên quan gì. Những hướng dẫn quy trình dài nên nằm trong một skill, thứ chỉ được nạp khi được gọi. Có thêm chi tiết về điều đó trong hướng dẫn về tệp ngữ cảnh AGENTS.md.
Nếu bạn muốn bản dài hơn dành riêng cho khía cạnh cắt giảm chi phí, giảm chi phí token Claude Code đi qua từng điểm một cách chi tiết.
Tóm lại trong vài dòng
Hãy thôi tìm một số dư token: gói của bạn không có cái đó. Hãy học thuộc hai khung thời gian, đọc /usage để xem phần phân bổ chứ không phải để lấy một tổng số, và coi cache là thứ quyết định cả tuần của bạn. Những lập trình viên không bao giờ chạm giới hạn hiếm khi là những người gõ ít hơn. Họ là những người mở một phiên mới khi chủ đề thay đổi.
Chạy nhiều agent cùng lúc làm cho tất cả những điều này vừa tệ hơn vừa dễ nhìn ra hơn, vì mức tiêu thụ thôi không còn là một con số duy nhất mà trở thành một con số cho mỗi agent. Đó chính là góc nhìn mà AgentsRoom được xây dựng xoay quanh.
Câu hỏi thường gặp
Tôi còn bao nhiêu token trong Claude?
Không hề có con số nào như vậy để tra cứu. Gói đăng ký Claude không được bán dưới dạng ngân sách token: nó được đo bằng tỷ lệ của một khung thời gian phiên trượt cộng với một khung thời gian hàng tuần, và thứ bạn đọc được là phần trăm của các khung đó cùng thời điểm chúng được đặt lại, chứ không phải một số dư token. Nơi để đọc nó là lệnh /usage bên trong Claude Code, hoặc Settings rồi Usage trên claude.ai. Chỉ trên API, vốn tính tiền theo từng token, một con số token mới có ý nghĩa.
Token của Claude hoạt động như thế nào?
Token là một mảnh văn bản, khoảng ba phần tư một từ trong tiếng Anh và ít hơn thế trong mã nguồn. Mỗi yêu cầu đều gửi lại toàn bộ cuộc trò chuyện của bạn, nên một phiên lập trình phải trả tiền cho phần lịch sử đã tích lũy ở mỗi lượt, chứ không chỉ cho câu bạn vừa gõ. Đó là lý do mức sử dụng được đếm bằng bốn con số riêng biệt: input, output, ghi cache và đọc cache. Phần lịch sử đã được cache bị tính ở mức giá thấp hơn nhiều so với input mới, và đó chính là lý do một phiên để mở suốt cả ngày vẫn hao vào gói của bạn.
Khi nào mức sử dụng Claude của tôi được đặt lại?
Có hai chiếc đồng hồ và chúng độc lập với nhau. Khung thời gian phiên trượt theo thời gian, nên nó hết hạn sau một số giờ cố định kể từ lúc mở chứ không phải vào một thời điểm bạn chọn. Khung thời gian hàng tuần nằm bên trên nó và được đặt lại vào một thời điểm cố định gán cho tài khoản của bạn. Chính thông báo giới hạn cho bạn biết khi nào khung đã chặn bạn sẽ quay trở lại, và thông báo đó là câu trả lời chính thức cho tài khoản của bạn. Hai chiếc đồng hồ này dùng chung giữa Claude chat và Claude Code, nên dùng chat nhiều sẽ rút ngắn ngân sách lập trình của bạn.
Chuyển sang mô hình rẻ hơn có trả lại giới hạn cho tôi không?
Không. Khung thời gian phiên và khung thời gian hàng tuần được dùng chung giữa các mô hình, nên chuyển bằng /model không khôi phục quyền truy cập một khi bạn đã chạm vào chúng. Nó có ích trong một trường hợp cụ thể: một thông báo gắn riêng với một mô hình, chẳng hạn khi bạn chạm giới hạn Opus, lúc đó chuyển sang Sonnet cho phép bạn tiếp tục làm việc. Nó cũng có ích trước khi bạn hết, vì một mô hình rẻ hơn tiêu ít hơn từ cùng hạn mức đó cho cùng khối lượng công việc.
Vì sao mức sử dụng của tôi tăng lên khi tôi không làm gì cả?
Vì trong một phiên chạy agent, sự nhàn rỗi không hề miễn phí. Bất cứ thứ gì khởi động một lượt đều gửi lại toàn bộ ngữ cảnh của bạn: một tác vụ hẹn giờ chạy đến hạn, một tin nhắn đến từ phiên khác, một agent đồng đội vẫn đang chạy, một lần điểm danh mục tiêu. Còn hai thứ nữa tốn token mà không cần đến một lượt nào: việc nén ngữ cảnh, vốn phải đọc cuộc trò chuyện mà nó tóm tắt, và tin nhắn đầu tiên sau một quãng nghỉ dài, vốn trượt prompt cache và xử lý lại toàn bộ lịch sử của bạn ở giá đầy đủ.
Cảnh báo ngữ cảnh có phải là giới hạn sử dụng không?
Không, và nhầm lẫn hai thứ này khiến người ta chọn sai cách khắc phục. Cảnh báo về ngữ cảnh hoặc auto-compact nói về một cuộc trò chuyện đang tiến gần cửa sổ ngữ cảnh của mô hình, và nó được giải quyết bằng cách chạy /clear hoặc nén phiên đó lại. Giới hạn sử dụng nói về hạn mức bao gồm trong gói của bạn trên toàn bộ các phiên, và việc chạy /clear không trả lại chút nào. Dấu hiệu nằm ở cách diễn đạt: thông báo giới hạn có nêu một thời điểm đặt lại, còn cảnh báo ngữ cảnh thì không.
Tải AgentsRoom
Chạy các agent AI của bạn (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) trên tất cả dự án, trong một cửa sổ duy nhất.
Ứng dụng đồng hành: theo dõi agent khi đi đường
Sử dụng Claude, Codex, Antigravity CLI hoặc nhà cung cấp AI khác.
Gửi lỗi và yêu cầu thẳng vào backlog công khai của bạn.
Một cái nhìn về AgentsRoom đang hoạt động.
Đọc thêm
Cách kiểm tra mức sử dụng token của Claude Code: 4 cách để xem các agent của bạn chi tiêu bao nhiêu
Bốn cách để kiểm tra mức sử dụng token của Claude Code: lệnh /cost, biên bản phiên, CLI ccusage và đồng hồ theo phiên trực tiếp. Xem chính xác mỗi agent chi tiêu bao nhiêu.
Đọc bài viếtCách mở rộng coding agent AI ra cả một đội phát triển
Một lập trình viên với một coding agent là câu chuyện năng suất. Năm lập trình viên với hai mươi agent là bài toán phối hợp. Đây là thứ vỡ đầu tiên khi một đội mở rộng quy mô, và thiết lập trụ được: file context đã commit, quyền sở hữu file rõ ràng, review theo bán kính vụ nổ, và chi phí bạn thực sự nhìn thấy được.
Đọc bài viếtCode giờ do agent viết. Đây là những gì nghề lập trình viên đã trở thành.
Viết code chỉ là một mắt xích trong chuỗi sáu mắt xích, và đó đúng là mắt xích agent đã lấy đi. Năm mắt xích còn lại nặng thêm. Đây là phần nghề còn lại: nghe xem cần xây gì, quyết định, ra đề bài, điều phối, duyệt và phát hành.
Đọc bài viết