Quantos tokens ainda me restam no Claude? Esse número não existe.

Sua assinatura do Claude não é medida em tokens, então nenhuma tela mostra um saldo de tokens. Veja o que ela realmente mede, onde ler isso e por que ela se esgota mesmo quando você não está digitando.

Essa é uma das perguntas mais pesquisadas sobre o Claude, e ela aparece em quase todos os idiomas. Também tem uma resposta incômoda: esse número não existe, porque sua assinatura não é vendida em tokens.

Isso não é um detalhe técnico. É o que explica por que você não encontra o contador que procura, por que toda página que diz mostrar um está chutando, e por que aquilo que realmente te trava no meio de uma tarefa não é aquilo que a maioria das pessoas fica observando.

Sua assinatura é medida em janelas, não em tokens

A Anthropic não descreve uma assinatura do Claude como uma cota de tokens. Ela a mede em janelas de uso: uma janela de sessão que é móvel, e uma janela semanal por cima dela. As duas são compartilhadas entre todas as superfícies em que você faz login, então uma tarde longa no chat do Claude deixa menos espaço para o Claude Code à noite. As duas também são compartilhadas entre os modelos, e é por isso que trocar para um modelo mais barato com /model não devolve o seu limite depois que você já bateu nele.

O que você consegue ler, portanto, é uma fração de uma janela e o horário em que ela volta, não um saldo. Quando você realmente esgota a cota, a mensagem que te bloqueia diz qual teto você atingiu e quando ele é reiniciado, e essa mensagem é o único dado com autoridade sobre a sua conta.

O único lugar em que uma contagem de tokens significa algo literal é a API, que é cobrada por token. Tudo o que vem abaixo trata da assinatura, que é sobre o que a maioria das pessoas está de fato perguntando.

O número que dá para ler, e onde ele fica

São duas telas, e elas respondem a perguntas diferentes.

Dentro do Claude Code, /usage é o que vale a pena aprender. Em uma assinatura Pro, Max, Team ou Enterprise, ele mostra as barras de uso dos limites da sua assinatura, e você pressiona d ou w para alternar entre as últimas 24 horas e os últimos 7 dias. Abaixo das barras ele faz algo mais útil do que qualquer número bruto: ele atribui o uso recente a skills, subagentes, plugins e servidores MCP individuais, cada um em porcentagem, e levanta um alerta de comportamento quando um padrão responde por 10% ou mais do seu consumo recente, como contexto longo ou falhas de cache.

Uma ressalva importa, e é fácil deixar passar: esses valores são calculados a partir do histórico local das suas sessões naquela máquina. O trabalho feito em outro notebook, ou no claude.ai, não entra na conta.

Na web, Configurações e depois Uso no claude.ai é a visão no nível da conta: a sua assinatura, em que ponto você está e quando a janela semanal é reiniciada. Se você trabalha em duas máquinas, essa é a visão completa.

Para um detalhamento por sessão do que um trabalho custou de fato, o bloco no topo do /usage imprime as contagens brutas:

Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write

Esses quatro números são a história completa de uma sessão de programação, e o maior deles é quase sempre o cache read. Se você quer essa visão de forma contínua em vez de sob demanda, o AgentsRoom mantém um medidor de tokens ao vivo em cada sessão ao lado do terminal, com a mesma divisão entre input, output e cache, e um selo vermelho quando uma sessão começa a esquentar. A versão passo a passo de como ler o contador do próprio CLI está em como verificar o uso de tokens do Claude Code.

O que é de fato um token quando existe um agente envolvido

Um token é um fragmento de texto: mais ou menos três quartos de uma palavra em inglês, e bem menos em código, onde a pontuação e os identificadores se fragmentam com facilidade.

A parte que surpreende as pessoas é que uma conversa é reenviada por inteiro a cada requisição. Faça uma pergunta de uma linha em uma sessão aberta desde de manhã e você não está pagando por aquela linha, está pagando por todo o histórico que viaja junto com ela. Cada vez que o agente usa uma ferramenta, ele envia outra requisição, levando junto os resultados anteriores das ferramentas, e é por isso que um simples "conserta esse teste" pode virar uma dúzia de idas e vindas.

O cache de prompt é o que torna isso suportável. O histórico repetido é cobrado a uma tarifa de cache bem mais baixa, e é por isso que o número de cache read é enorme e a conta não é. Ele também prepara o terreno para o hábito mais caro do trabalho com agentes, que é o assunto da próxima seção.

Por que a barra de uso sobe mesmo sem você digitar

Se o seu uso sobe em uma sessão parada, é por um destes motivos, e nenhum deles é um bug:

  • O cache expirando. O contexto em cache dura cerca de uma hora em uma assinatura, e cai para cinco minutos assim que você passa a consumir créditos de uso, ou usa uma chave de API. Volte do almoço e a sua primeira mensagem erra o cache: toda a sua conversa é reprocessada a preço cheio. Uma pausa, um reprocessamento completo.
  • Qualquer coisa que inicie um turno sozinha. Uma tarefa agendada disparando, uma mensagem chegando de outra das suas sessões, uma verificação de objetivo enquanto um trabalho roda em segundo plano. Cada uma reenvia o contexto inteiro, exatamente como uma mensagem que você digitou.
  • Os agentes colegas de equipe. Cada colega de equipe ativo roda a própria janela de contexto e continua consumindo até encerrar. A própria orientação da Anthropic coloca uma equipe em modo de planejamento em cerca de sete vezes uma sessão padrão.
  • A compactação. O /compact precisa ler a conversa que resume, então compactar um contexto grande é, por si só, uma requisição grande. O /clear não custa nada, e quando você não precisa de continuidade ele é a melhor escolha.
  • O trabalho em segundo plano. Os resumos para o --resume e tarefas parecidas consomem um pouco mesmo quando você está parado, em geral menos de quatro centavos de dólar por sessão.

É aqui também que os dois avisos que as pessoas confundem se separam. Um aviso de contexto ou de compactação automática diz que uma conversa está chegando perto da janela de contexto do modelo, e limpar aquela sessão resolve. Um limite de uso diz que a cota incluída na sua assinatura foi gasta em todas as sessões, e limpar não devolve nada dela. O sinal confiável: um limite de uso indica um horário de reinício, um aviso de contexto não.

O que fazer quando a barra está quase cheia

Em ordem aproximada de quanto cada um devolve pelo esforço investido:

  1. Rode /clear entre tarefas sem relação. O contexto velho é reenviado a cada mensagem pelo resto da sessão. Use /rename antes do /clear se quiser encontrar a sessão de novo com /resume.
  2. Ajuste o modelo à tarefa. O Sonnet dá conta da maior parte do trabalho de programação; manter o Opus como padrão é a causa mais comum de uma cota que evapora até quinta-feira.
  3. Leia a atribuição no /usage. Se um servidor MCP ou um subagente representa 30% da sua semana, é aí que está a correção, e você nunca teria adivinhado qual deles era.
  4. Reduza o raciocínio antes de desligá-lo. Os tokens de raciocínio são cobrados como output. Baixar o nível de esforço costuma ser suficiente.
  5. Empurre o trabalho verboso para os subagentes. A saída dos testes e os arquivos de log ficam no contexto do subagente e só um resumo volta.
  6. Mantenha o arquivo de contexto curto. Tudo o que está em CLAUDE.md ou AGENTS.md é carregado no início da sessão e pago a cada turno, inclusive quando é irrelevante. Instruções longas de fluxo de trabalho pertencem a uma skill, que só carrega quando é invocada. Tem mais sobre isso em o guia do arquivo de contexto AGENTS.md.

Se você quer a versão mais longa especificamente sobre o lado da redução de custos, reduzir os custos de tokens do Claude Code percorre o assunto em detalhe.

A versão curta

Pare de procurar um saldo de tokens: a sua assinatura não tem um. Aprenda como funcionam as duas janelas, leia o /usage em busca da atribuição e não de um total, e trate o cache como aquilo que decide a sua semana. Os desenvolvedores que nunca batem em um limite raramente são os que digitam menos. São os que começam uma sessão nova quando o assunto muda.

Rodar vários agentes ao mesmo tempo torna tudo isso ao mesmo tempo pior e mais fácil de enxergar, porque o consumo deixa de ser um número e vira um número por agente. É em torno dessa visão que o AgentsRoom foi construído.

Perguntas frequentes

Quantos tokens ainda me restam no Claude?

Não existe esse número para consultar. Uma assinatura do Claude não é vendida como um orçamento de tokens: ela é medida como uma fração de uma janela de sessão móvel somada a uma janela semanal, e o que você consegue ler é uma porcentagem dessas janelas e o horário em que elas são reiniciadas, não um saldo de tokens. O lugar para ler isso é o comando /usage dentro do Claude Code, ou Configurações e depois Uso no claude.ai. Só na API, cobrada por token, é que um número de tokens significa alguma coisa.

Como funcionam os tokens do Claude?

Um token é um fragmento de texto, mais ou menos três quartos de uma palavra em inglês e menos em código. Cada requisição envia a sua conversa inteira de novo, então uma sessão de programação paga pelo histórico acumulado a cada turno, e não só pela frase que você digitou. É por isso que o uso é contado em quatro números separados: input, output, escrita de cache e leitura de cache. O histórico em cache é cobrado a uma tarifa bem mais baixa do que a entrada nova, que é exatamente o motivo pelo qual uma sessão deixada aberta o dia todo continua consumindo da sua assinatura.

Quando o meu uso do Claude é reiniciado?

São dois relógios e eles são independentes. A janela de sessão é móvel, então ela expira um número fixo de horas depois de ter sido aberta, e não em um horário escolhido por você. Uma janela semanal fica por cima dela e é reiniciada em um momento fixo atribuído à sua conta. A própria mensagem de limite diz quando volta a janela que te bloqueou, e essa mensagem é a resposta com autoridade sobre a sua conta. Os dois relógios são compartilhados entre o chat do Claude e o Claude Code, então usar muito o chat encurta o seu orçamento para programar.

Trocar para um modelo mais barato devolve o meu limite?

Não. As janelas de sessão e semanal são compartilhadas entre os modelos, então trocar com /model não restaura o acesso depois que você já bateu nelas. Isso ajuda em um caso específico: uma mensagem ligada a um modelo, como atingir o limite do Opus, em que passar para o Sonnet permite continuar trabalhando. Também ajuda antes de você esgotar a cota, porque um modelo mais barato consome menos da mesma cota incluída para o mesmo trabalho.

Por que o meu uso sobe quando não estou fazendo nada?

Porque ficar parado não é de graça em uma sessão com agentes. Qualquer coisa que inicie um turno reenvia todo o seu contexto: uma tarefa agendada disparando, uma mensagem chegando de outra sessão, um agente colega de equipe ainda em execução, uma verificação de objetivo. Outras duas coisas custam tokens sem um turno: a compactação, que precisa ler a conversa que resume, e a primeira mensagem depois de uma pausa longa, que erra o cache de prompt e reprocessa todo o seu histórico a preço cheio.

Um aviso de contexto é a mesma coisa que um limite de uso?

Não, e confundir os dois leva as pessoas à correção errada. Um aviso de contexto ou de compactação automática é sobre uma conversa chegando perto da janela de contexto do modelo, e se resolve limpando ou compactando aquela sessão. Um limite de uso é sobre a cota incluída na sua assinatura considerando todas as sessões, e limpar não devolve nada dela. O sinal está na formulação: uma mensagem de limite indica um horário de reinício, um aviso de contexto não.

Baixar AgentsRoom

Rode seus agentes de IA (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) em todos os seus projetos, de uma única janela.

GrátisBaixar AgentsRoom

App complementar: acompanhe seus agentes em qualquer lugar

Use Claude, Codex, Antigravity CLI ou outro provedor de IA.

Instalar a extensão
Chrome Web Store

Envie bugs e pedidos direto para o seu backlog público.

Uma visão do AgentsRoom em ação.

Multi-projetos
Multi-provedor
Multi-agentes
Status ao vivo
Diff e commit
App mobile
Preview ao vivo
Equipes de agentes
Testes no navegador
Dev guiada por backlog
Biblioteca de prompts
Biblioteca de skills
Ver todas as funcionalidades

Continue lendo