Claude에 토큰이 얼마나 남았을까요? 그런 숫자는 애초에 없습니다.

Claude 구독 요금제는 토큰 단위로 팔리지 않기 때문에 토큰 잔액을 보여 주는 화면도 없습니다. 실제로 무엇을 측정하는지, 어디서 읽는지, 그리고 아무것도 입력하지 않는 동안에도 왜 줄어드는지 정리했습니다.

Claude에 관해 가장 많이 검색되는 질문 중 하나이고, 거의 모든 언어권에서 똑같이 묻습니다. 그리고 답은 조금 불편합니다. 그런 숫자는 존재하지 않습니다. 여러분의 요금제가 토큰 단위로 팔리는 것이 아니기 때문입니다.

이것은 사소한 기술적 차이가 아닙니다. 왜 찾고 있는 카운터가 어디에도 없는지, 왜 그 숫자를 보여 준다고 주장하는 페이지가 전부 추측에 불과한지, 그리고 왜 작업 도중 실제로 여러분을 멈춰 세우는 것이 대부분의 사람이 지켜보는 대상과 다른지를 설명해 줍니다.

요금제는 토큰이 아니라 사용 기간으로 측정됩니다

Anthropic은 Claude 구독을 토큰 한도로 표현하지 않습니다. 대신 사용량 기간으로 측정합니다. 열린 시점을 기준으로 이동하는 세션 사용 기간, 그리고 그 위에 얹히는 주간 사용 기간입니다. 두 기간 모두 로그인하는 모든 창구에서 공유되므로, 오후 내내 Claude 채팅을 붙들고 있었다면 그날 저녁 Claude Code에 남는 여유가 그만큼 줄어듭니다. 두 기간은 모델 사이에서도 공유됩니다. 한도에 이미 도달한 뒤에 /model로 더 저렴한 모델로 바꿔도 한도가 돌아오지 않는 이유가 바로 이것입니다.

따라서 여러분이 읽을 수 있는 것은 잔액이 아니라 사용 기간의 소진 비율과 그 기간이 돌아오는 시각입니다. 실제로 한도를 다 쓰면, 작업을 멈추는 안내 메시지가 어떤 상한에 걸렸는지와 언제 초기화되는지를 알려 줍니다. 그 메시지가 여러분 계정에 대해 신뢰할 수 있는 유일한 수치입니다.

토큰 수가 문자 그대로의 의미를 갖는 유일한 곳은 토큰 단위로 과금되는 API입니다. 아래 내용은 전부 구독 요금제에 관한 것이며, 대부분의 사람이 실제로 궁금해하는 것도 그쪽입니다.

실제로 읽을 수 있는 숫자와 그 숫자가 있는 곳

화면은 두 곳이고, 각각 다른 질문에 답합니다.

**Claude Code 안에서는 /usage**를 익혀 둘 만합니다. Pro, Max, Team, Enterprise 요금제에서는 요금제 한도에 대한 사용량 막대를 보여 주고, dw를 누르면 최근 24시간과 최근 7일 사이를 오갈 수 있습니다. 막대 아래에는 어떤 원시 수치보다 유용한 정보가 있습니다. 최근 사용량을 스킬, 서브에이전트, 플러그인, 개별 MCP 서버에 귀속시켜 각각 백분율로 보여 주고, 긴 컨텍스트나 캐시 미스처럼 한 가지 패턴이 최근 소비의 10% 이상을 차지하면 동작 플래그를 띄웁니다.

놓치기 쉬운 주의사항이 하나 있습니다. 이 수치는 그 컴퓨터에 있는 로컬 세션 기록으로 계산됩니다. 다른 노트북에서 한 작업이나 claude.ai에서 한 작업은 여기에 들어 있지 않습니다.

웹에서는 claude.ai의 Settings에서 Usage가 계정 단위의 화면입니다. 사용 중인 요금제, 현재 어디까지 썼는지, 주간 사용 기간이 언제 초기화되는지를 보여 줍니다. 컴퓨터 두 대를 오가며 일한다면 빠짐없이 집계되는 쪽은 이 화면입니다.

어떤 작업이 실제로 얼마나 들었는지 세션 단위로 쪼개서 보고 싶다면, /usage 상단 블록이 원시 수치를 출력합니다:

Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write

이 네 개의 숫자가 코딩 세션의 전부이며, 그중 가장 큰 값은 거의 언제나 cache read입니다. 필요할 때마다 명령을 치는 대신 이 화면을 계속 켜 두고 싶다면, AgentsRoom은 모든 세션에 실시간 토큰 미터를 띄워 둡니다. 터미널 옆에서 입력, 출력, 캐시를 같은 방식으로 나눠 보여 주고, 세션이 과열되기 시작하면 빨간 배지를 띄웁니다. CLI 자체 카운터를 읽는 단계별 방법은 Claude Code 토큰 사용량 확인 방법에서 다룹니다.

에이전트가 개입하면 토큰은 실제로 무엇을 의미하는가

토큰은 텍스트 조각입니다. 영어로는 대략 한 단어의 4분의 3에 해당하고, 구두점과 식별자가 쉽게 쪼개지는 코드에서는 그보다 눈에 띄게 적습니다.

사람들이 놀라는 지점은 요청할 때마다 대화 전체가 다시 전송된다는 것입니다. 아침부터 열어 둔 세션에서 한 줄짜리 질문을 던지면, 비용을 내는 대상은 그 한 줄이 아니라 그 줄과 함께 실려 가는 대화 기록 전체입니다. 에이전트가 도구를 쓸 때마다 이전 도구 결과를 들고 또 한 번 요청을 보내는데, "이 테스트 좀 고쳐 줘" 한 마디가 열 번이 넘는 왕복으로 불어나는 이유가 여기에 있습니다.

이것을 버틸 만하게 만들어 주는 것이 프롬프트 캐싱입니다. 반복되는 대화 기록은 훨씬 낮은 캐시 요율로 계산되며, cache read 수치가 어마어마한데도 청구액은 그렇지 않은 이유가 바로 그것입니다. 동시에 이 구조는 에이전트 작업에서 가장 비싼 습관 하나를 만들어 내는데, 그것이 다음 섹션의 주제입니다.

아무것도 입력하지 않는데 막대가 움직이는 이유

세션을 놀려 두었는데도 사용량이 올라간다면 아래 중 하나이며, 어느 것도 버그가 아닙니다:

  • 캐시 만료. 캐시된 컨텍스트는 구독 요금제에서 약 한 시간 유지되고, 사용량 크레딧을 끌어 쓰기 시작하거나 API 키를 쓰면 5분으로 줄어듭니다. 점심을 먹고 돌아와 보내는 첫 메시지는 캐시를 놓치고, 대화 전체가 정가로 다시 처리됩니다. 한 번 쉬면 한 번 통째로 재처리되는 셈입니다.
  • 스스로 턴을 시작하는 모든 것. 예약 작업의 실행, 여러분의 다른 세션에서 도착한 메시지, 백그라운드 작업이 도는 동안의 목표 체크인이 그렇습니다. 하나하나가 여러분이 직접 입력한 메시지와 똑같이 컨텍스트 전체를 다시 보냅니다.
  • 에이전트 팀원. 활동 중인 팀원 에이전트는 저마다 자기 컨텍스트 윈도우를 돌리며, 종료될 때까지 계속 소비합니다. Anthropic의 공식 안내도 플랜 모드로 도는 팀 하나를 일반 세션의 약 7배로 잡습니다.
  • 압축. /compact는 요약할 대화를 읽어야 하므로, 큰 컨텍스트를 압축하는 일 자체가 큰 요청입니다. /clear는 비용이 들지 않으니, 이어서 할 필요가 없는 상황이라면 이쪽이 더 나은 선택입니다.
  • 백그라운드 작업. --resume을 위한 요약처럼 자잘한 일들은 여러분이 놀고 있을 때도 소량을 소모합니다. 보통 세션당 4센트 미만입니다.

사람들이 뒤섞어 이해하는 두 가지 경고가 갈라지는 지점도 여기입니다. 컨텍스트 경고 또는 자동 압축 경고는 대화 하나가 모델의 컨텍스트 윈도우에 가까워졌다는 뜻이고, 그 세션에서 /clear를 실행하면 해결됩니다. 사용 한도는 모든 세션을 통틀어 요금제에 포함된 사용 한도를 다 썼다는 뜻이며, /clear를 해도 한도는 조금도 돌아오지 않습니다. 확실한 구분 기준은 이것입니다. 사용 한도는 초기화 시각을 명시하고, 컨텍스트 경고는 그렇지 않습니다.

막대가 거의 다 찼을 때 할 일

들인 노력 대비 돌아오는 것이 큰 순서대로 대략 정리하면 다음과 같습니다:

  1. 서로 무관한 작업 사이에는 /clear를 실행하세요. 낡은 컨텍스트는 그 세션이 끝날 때까지 매 메시지마다 다시 전송됩니다. 나중에 /resume으로 다시 찾고 싶다면 /clear 전에 /rename을 해 두세요.
  2. 작업에 맞는 모델을 고르세요. 코딩 작업 대부분은 Sonnet으로 충분합니다. Opus를 기본값으로 두는 것이 목요일이면 사용 한도가 사라져 있는 가장 흔한 원인입니다.
  3. /usage의 귀속 정보를 읽으세요. MCP 서버 하나나 서브에이전트 하나가 한 주 사용량의 30%를 차지하고 있다면 그것이 답인데, 어느 쪽인지는 짐작으로 절대 맞히지 못했을 것입니다.
  4. 사고 기능은 끄기 전에 먼저 낮추세요. 사고 토큰은 출력으로 과금됩니다. 모델의 추론 노력 수준을 낮추는 것만으로 대개 충분합니다.
  5. 말이 길어지는 작업은 서브에이전트로 넘기세요. 테스트 출력과 로그 파일은 서브에이전트의 컨텍스트에 남고, 돌아오는 것은 요약뿐입니다.
  6. 컨텍스트 파일을 짧게 유지하세요. CLAUDE.mdAGENTS.md에 들어 있는 내용은 세션 시작 시 로드되어 매 턴 비용이 발생하며, 지금 작업과 아무 상관이 없을 때도 마찬가지입니다. 긴 워크플로 지침은 스킬에 넣어야 하고, 스킬은 호출될 때만 로드됩니다. 이에 관한 자세한 내용은 AGENTS.md 컨텍스트 파일 가이드에 있습니다.

비용 절감 쪽만 더 길게 다룬 글을 찾는다면 Claude Code 토큰 비용 줄이기가 그 내용을 자세히 짚어 줍니다.

짧게 정리하면

토큰 잔액을 찾는 일은 그만두세요. 여러분의 요금제에는 그런 것이 없습니다. 두 개의 사용 기간을 익히고, /usage는 총합이 아니라 귀속 정보를 보려고 읽으며, 한 주의 성패를 가르는 것은 캐시라고 생각하세요. 한도에 걸리지 않는 개발자는 입력을 적게 하는 사람인 경우가 드뭅니다. 주제가 바뀌면 새 세션을 시작하는 사람입니다.

여러 에이전트를 동시에 돌리면 이 모든 것이 더 심해지는 동시에 더 잘 보이게 됩니다. 소비가 하나의 숫자이기를 그치고 에이전트마다 하나씩의 숫자가 되기 때문입니다. AgentsRoom은 바로 그 화면을 중심으로 만들어졌습니다.

자주 묻는 질문

Claude에 토큰이 얼마나 남았나요?

찾아볼 수 있는 그런 숫자는 없습니다. Claude 구독은 토큰 예산으로 팔리지 않습니다. 이동식으로 갱신되는 세션 사용 기간과 주간 사용 기간의 소진 비율로 측정되며, 여러분이 읽을 수 있는 것은 토큰 잔액이 아니라 그 두 기간의 사용 비율과 초기화 시각입니다. 확인하는 곳은 Claude Code 안의 /usage 명령, 또는 claude.ai의 Settings에서 Usage입니다. 토큰 수치가 무언가를 의미하는 곳은 토큰 단위로 과금되는 API뿐입니다.

Claude의 토큰은 어떻게 작동하나요?

토큰은 텍스트 조각으로, 영어로는 대략 한 단어의 4분의 3이고 코드에서는 그보다 적습니다. 요청할 때마다 대화 전체가 다시 전송되므로, 코딩 세션은 여러분이 입력한 문장만이 아니라 그때까지 쌓인 대화 기록에 대해 매 턴 비용을 냅니다. 사용량이 입력, 출력, 캐시 쓰기, 캐시 읽기라는 네 개의 수치로 나뉘어 집계되는 이유가 바로 이것입니다. 캐시된 기록은 새 입력보다 훨씬 낮은 요율로 계산되며, 하루 종일 열어 둔 세션이 그럼에도 요금제를 갉아먹는 이유도 여기에 있습니다.

Claude 사용량은 언제 초기화되나요?

시계는 두 개이고 서로 독립적입니다. 세션 사용 기간은 이동식이어서, 여러분이 고른 시각이 아니라 그 기간이 열린 뒤 정해진 시간이 지나면 만료됩니다. 그 위에 주간 사용 기간이 얹혀 있고, 계정마다 배정된 고정된 시점에 초기화됩니다. 한도 안내 메시지 자체가 여러분을 멈춰 세운 기간이 언제 돌아오는지 알려 주며, 그 메시지가 여러분 계정에 대한 확실한 답입니다. 두 시계는 Claude 채팅과 Claude Code가 함께 쓰기 때문에, 채팅을 많이 쓰면 코딩에 쓸 예산이 그만큼 줄어듭니다.

더 저렴한 모델로 바꾸면 한도가 돌아오나요?

아닙니다. 세션 사용 기간과 주간 사용 기간은 모델 사이에서 공유되므로, 이미 한도에 도달한 뒤에는 /model로 바꿔도 접근이 복구되지 않습니다. 도움이 되는 경우는 하나뿐입니다. Opus 한도에 걸렸다는 식으로 특정 모델에만 해당하는 메시지가 떴을 때는 Sonnet으로 옮기면 작업을 이어 갈 수 있습니다. 한도를 다 쓰기 전이라면 더 저렴한 모델이 같은 작업에 같은 사용 한도를 덜 소비하므로, 그때도 도움이 됩니다.

아무것도 하지 않는데 왜 사용량이 올라가나요?

에이전트 세션에서는 놀고 있는 시간도 공짜가 아니기 때문입니다. 턴을 시작하는 모든 것이 컨텍스트 전체를 다시 보냅니다. 예약 작업의 실행, 다른 세션에서 도착한 메시지, 아직 돌고 있는 에이전트 팀원, 목표 체크인이 그렇습니다. 턴 없이도 토큰을 쓰는 것이 두 가지 더 있습니다. 요약할 대화를 읽어야 하는 압축, 그리고 오래 쉰 뒤에 보내는 첫 메시지입니다. 첫 메시지는 프롬프트 캐시를 놓쳐서 대화 기록 전체를 정가로 다시 처리합니다.

컨텍스트 경고와 사용 한도는 같은 것인가요?

아닙니다. 그리고 이 둘을 헷갈리면 엉뚱한 해결책을 쓰게 됩니다. 컨텍스트 경고 또는 자동 압축 경고는 대화 하나가 모델의 컨텍스트 윈도우에 가까워졌다는 뜻이고, 그 세션에서 /clear/compact를 실행하면 해결됩니다. 사용 한도는 모든 세션을 통틀어 요금제에 포함된 사용 한도에 관한 것이며, /clear를 해도 한도는 조금도 돌아오지 않습니다. 구분하는 단서는 문구에 있습니다. 한도 메시지는 초기화 시각을 명시하고, 컨텍스트 경고는 그렇지 않습니다.

AgentsRoom 다운로드

모든 프로젝트에서 AI 에이전트(Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code)를 하나의 창에서 실행하세요.

무료AgentsRoom 다운로드

컴패니언 앱: 이동 중에도 에이전트를 모니터링

Claude, Codex, Antigravity CLI 또는 다른 AI 공급자를 사용하세요.

확장 프로그램 설치
Chrome Web Store

버그와 요청을 공개 백로그로 바로 보내세요.

AgentsRoom의 실제 모습.

멀티 프로젝트
멀티 프로바이더
멀티 에이전트
실시간 상태
파일 diff & 커밋
모바일 앱
라이브 프리뷰
에이전트 팀
브라우저 자동화
백로그 기반 개발
프롬프트 라이브러리
스킬 라이브러리
모든 기능 보기

계속 읽기