¿Cuántos tokens me quedan en Claude? No existe ese número.
Su plan de Claude no está denominado en tokens, así que ninguna pantalla muestra un saldo de tokens. Esto es lo que mide realmente, dónde consultarlo y por qué se consume mientras usted no escribe nada.
Es una de las preguntas más buscadas sobre Claude, y se formula en casi todos los idiomas. También tiene una respuesta incómoda: ese número no existe, porque su plan no se vende en tokens.
No es un tecnicismo. Explica por qué no encuentra el contador que busca, por qué toda página que afirma mostrárselo está adivinando, y por qué aquello que de verdad lo detiene a mitad de una tarea no es lo que la mayoría de la gente vigila.
Su plan se mide en ventanas, no en tokens
Anthropic no expresa una suscripción a Claude como un cupo de tokens. La mide en ventanas de uso: una ventana de sesión que se desplaza, y una ventana semanal por encima de ella. Ambas se comparten entre todas las superficies en las que usted inicia sesión, así que una tarde larga en el chat de Claude le deja menos margen para Claude Code esa misma noche. Ambas se comparten también entre modelos, y por eso cambiar a un modelo más barato con /model no le devuelve el límite una vez que lo ha alcanzado.
Lo que usted puede leer es, por tanto, una porción de una ventana y la hora a la que vuelve, no un saldo. Cuando de verdad se queda sin margen, el mensaje que lo detiene indica qué techo ha alcanzado y cuándo se reinicia, y ese mensaje es la única cifra con autoridad para su cuenta.
El único sitio donde un recuento de tokens significa algo literal es la API, que se factura por token. Todo lo que sigue trata de la suscripción, que es por lo que en realidad pregunta la mayoría de la gente.
La cifra que sí puede leer, y dónde vive
Dos pantallas, y responden a preguntas distintas.
Dentro de Claude Code, /usage es la que merece la pena aprender. En un plan Pro, Max, Team o Enterprise muestra las barras de uso de los límites de su plan, y pulsando d o w se alterna entre las últimas 24 horas y los últimos 7 días. Debajo de las barras hace algo más útil que cualquier cifra en bruto: atribuye el uso reciente a skills, subagentes, plugins y servidores MCP concretos, cada uno con su porcentaje, y levanta una alerta de comportamiento cuando un solo patrón representa el 10% o más de su consumo reciente, como un contexto largo o los fallos de caché.
Hay una salvedad importante y fácil de pasar por alto: esas cifras se calculan a partir del historial local de sus sesiones en esa máquina. El trabajo hecho desde otro portátil, o en claude.ai, no aparece en ellas.
En la web, Settings y luego Usage en claude.ai es la vista a nivel de cuenta: su plan, en qué punto está y cuándo se reinicia la ventana semanal. Si trabaja en dos máquinas, esta es la que está completa.
Para un desglose por sesión de lo que ha costado realmente un trabajo concreto, el bloque superior de /usage imprime los recuentos en bruto:
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write
Esos cuatro números son toda la historia de una sesión de programación, y el mayor de ellos es casi siempre cache read. Si quiere esa vista de forma continua en lugar de bajo demanda, AgentsRoom mantiene un medidor de tokens en vivo en cada sesión junto a la terminal, con el mismo desglose de entrada, salida y caché, y un distintivo rojo cuando una sesión empieza a calentarse. La versión paso a paso de cómo leer el contador propio de la CLI está en cómo comprobar el uso de tokens de Claude Code.
Qué es realmente un token cuando hay un agente de por medio
Un token es un fragmento de texto: aproximadamente tres cuartas partes de una palabra en inglés, y bastante menos en código, donde la puntuación y los identificadores se fragmentan con facilidad.
La parte que sorprende a la gente es que una conversación se reenvía entera en cada petición. Haga una pregunta de una línea en una sesión abierta desde por la mañana y no está pagando por esa línea, está pagando por todo el historial que viaja con ella. Cada vez que el agente usa una herramienta envía otra petición, arrastrando consigo los resultados de las herramientas anteriores, y por eso un simple «arregla este test» puede convertirse en una docena de idas y vueltas.
El almacenamiento en caché del prompt es lo que hace esto soportable. El historial repetido se cobra a una tarifa de caché mucho más baja, y por eso la cifra de cache read es enorme y la factura no lo es. También prepara el terreno para el hábito más caro del trabajo con agentes, que es el tema de la sección siguiente.
Por qué la barra sube mientras usted no escribe nada
Si su consumo sube en una sesión inactiva, es por una de estas razones, y ninguna de ellas es un fallo:
- La caché que caduca. El contexto en caché vive alrededor de una hora en una suscripción, y baja a cinco minutos en cuanto usted tira de créditos de uso, o de una clave de API. Vuelva de comer y su primer mensaje falla la caché: toda su conversación se reprocesa a precio completo. Una pausa, un reprocesamiento entero.
- Cualquier cosa que inicie un turno por su cuenta. Una tarea programada que se dispara, un mensaje que llega desde otra de sus sesiones, una revisión de objetivo mientras corre trabajo en segundo plano. Cada una reenvía el contexto completo, exactamente igual que un mensaje escrito por usted.
- Los agentes compañeros de equipo. Cada compañero activo tiene su propia ventana de contexto y sigue consumiendo hasta que termina. La propia guía de Anthropic sitúa un equipo en modo plan en torno a siete veces una sesión estándar.
- La compactación.
/compacttiene que leer la conversación que resume, así que compactar un contexto grande es en sí mismo una petición grande./clearno cuesta nada y, cuando no necesita continuidad, es la mejor jugada. - El trabajo en segundo plano. Los resúmenes para
--resumey tareas rutinarias parecidas consumen una cantidad pequeña incluso cuando usted está inactivo, normalmente por debajo de cuatro centavos por sesión.
Aquí es también donde se separan los dos avisos que la gente confunde. Un aviso de contexto o de compactación automática dice que una conversación se está acercando a la ventana de contexto del modelo, y ejecutar /clear en esa sesión lo arregla. Un límite de uso dice que el cupo de su plan se ha agotado en todas las sesiones, y ejecutar /clear no devuelve nada de él. La señal fiable: un límite de uso indica una hora de reinicio, un aviso de contexto no.
Qué hacer cuando la barra está casi llena
Más o menos en orden de lo que devuelven a cambio del esfuerzo:
- Ejecute
/clearentre tareas que no tengan relación. El contexto obsoleto se reenvía en cada mensaje durante el resto de la sesión. Use/renameantes de/clearsi quiere volver a encontrarla con/resume. - Ajuste el modelo a la tarea. Sonnet se ocupa de la mayor parte del trabajo de programación; dejar Opus como modelo por defecto es la causa más frecuente de un cupo que se esfuma para el jueves.
- Lea la atribución de
/usage. Si un servidor MCP o un subagente supone el 30% de su semana, ahí está la solución, y nunca habría adivinado cuál era. - Baje el razonamiento antes de apagarlo. Los tokens de razonamiento se facturan como salida. Normalmente basta con bajar el nivel de esfuerzo.
- Empuje el trabajo verboso hacia los subagentes. La salida de los tests y los archivos de log se quedan en el contexto del subagente y solo vuelve un resumen.
- Mantenga corto el archivo de contexto. Todo lo que hay en
CLAUDE.mdoAGENTS.mdse carga al iniciar la sesión y se paga en cada turno, incluso cuando no viene al caso. Las instrucciones largas de flujo de trabajo van en una skill, que solo se carga cuando se la invoca. Hay más sobre esto en la guía del archivo de contexto AGENTS.md.
Si quiere la versión larga centrada en concreto en el ahorro de costes, reducir los costes de tokens de Claude Code lo repasa en detalle.
La versión corta
Deje de buscar un saldo de tokens: su plan no tiene ninguno. Aprenda cómo funcionan las dos ventanas, lea /usage buscando la atribución más que un total, y trate la caché como aquello que decide su semana. Los desarrolladores que nunca chocan con un límite rara vez son los que escriben menos. Son los que abren una sesión nueva cuando cambia el tema.
Ejecutar varios agentes a la vez empeora todo esto y a la vez lo hace más visible, porque el consumo deja de ser un solo número y pasa a ser un número por agente. Esa es la vista sobre la que está construido AgentsRoom.
Preguntas frecuentes
¿Cuántos tokens me quedan en Claude?
No existe ese número para consultarlo. Una suscripción a Claude no se vende como un presupuesto de tokens: se mide como una porción de una ventana de sesión móvil más una ventana semanal, y lo que usted puede leer es un porcentaje de esas ventanas y la hora a la que se reinician, no un saldo de tokens. El sitio donde consultarlo es el comando /usage dentro de Claude Code, o Settings y luego Usage en claude.ai. Solo en la API, facturada por token, una cifra de tokens significa algo.
¿Cómo funcionan los tokens de Claude?
Un token es un fragmento de texto, aproximadamente tres cuartas partes de una palabra en inglés y menos en código. Cada petición vuelve a enviar toda su conversación, así que una sesión de programación paga por su historial acumulado en cada turno, no solo por la frase que usted acaba de escribir. Por eso el uso se cuenta en cuatro cifras separadas: entrada, salida, escritura de caché y lectura de caché. El historial en caché se cobra a una tarifa mucho más baja que la entrada nueva, que es exactamente la razón por la que una sesión dejada abierta todo el día sigue tirando de su plan.
¿Cuándo se reinicia mi uso de Claude?
Hay dos relojes y son independientes. Una ventana de sesión es móvil, así que caduca un número fijo de horas después de haberse abierto y no a una hora elegida por usted. Una ventana semanal se sitúa por encima y se reinicia en un momento fijo asignado a su cuenta. El propio mensaje de límite le dice cuándo vuelve la ventana que lo ha detenido, y ese mensaje es la respuesta con autoridad para su cuenta. Los dos relojes se comparten entre el chat de Claude y Claude Code, así que un uso intenso del chat acorta su presupuesto para programar.
¿Cambiar a un modelo más barato me devuelve el límite?
No. Las ventanas de sesión y semanal se comparten entre modelos, así que cambiar con /model no restaura el acceso una vez que las ha alcanzado. Sí ayuda en un caso concreto: un mensaje específico de un modelo, como alcanzar su límite de Opus, donde pasar a Sonnet le permite seguir trabajando. También ayuda antes de quedarse sin margen, porque un modelo más barato consume menos del mismo cupo para el mismo trabajo.
¿Por qué sube mi consumo cuando no estoy haciendo nada?
Porque la inactividad no es gratis en una sesión de agente. Cualquier cosa que inicie un turno reenvía todo su contexto: una tarea programada que se dispara, un mensaje que llega desde otra sesión, un agente compañero que sigue en marcha, una revisión de objetivo. Otras dos cosas cuestan tokens sin que haya turno: la compactación, que tiene que leer la conversación que resume, y el primer mensaje tras una pausa larga, que falla la caché de prompt y reprocesa todo su historial a precio completo.
¿Es lo mismo un aviso de contexto que un límite de uso?
No, y confundir los dos lleva a la gente a la solución equivocada. Un aviso de contexto o de compactación automática trata de una sola conversación que se acerca a la ventana de contexto del modelo, y se resuelve ejecutando /clear o compactando esa sesión. Un límite de uso trata del cupo de su plan en todas las sesiones, y ejecutar /clear no devuelve nada de él. La pista está en la redacción: un mensaje de límite indica una hora de reinicio, un aviso de contexto no.
Descargar AgentsRoom
Ejecuta tus agentes de IA (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) en todos tus proyectos, desde una sola ventana.
App complementaria: supervisa tus agentes en movimiento
Usa Claude, Codex, Antigravity CLI u otro proveedor de IA.
Envía bugs y peticiones directamente a tu backlog público.
Un vistazo a AgentsRoom en acción.
Seguir leyendo
Cómo verificar el uso de tokens de Claude Code: 4 formas de ver lo que gastan tus agentes
Cuatro formas de verificar el uso de tokens de Claude Code: el comando /cost, las transcripciones de sesión, el CLI ccusage y un medidor en vivo por sesión. Ve exactamente lo que gasta cada agente.
Leer el artículoCómo Reducir los Costos de Tokens de Claude Code Sin Disminuir la Velocidad
Claude Code te cobra por token, y la mayor parte del gasto es invisible: contexto inflado, el modelo incorrecto, PDFs en bruto, agentes releyendo los mismos archivos. Aquí es donde realmente va el dinero y cómo reducirlo, con los hábitos y herramientas que mantienen tu factura baja sin ralentizarte.
Leer el artículoAhora el código lo escriben los agentes. Esto es en lo que se ha convertido el oficio del desarrollador.
Escribir código era un eslabón de seis, y es el que se han llevado los agentes. Los otros cinco pesan más. Recorrido por el oficio que queda: escuchar, decidir, encargar, pilotar, revisar y publicar.
Leer el artículo