Cómo reducir el consumo de tokens de Claude Code

Claude Code gasta la mayor parte de su presupuesto antes de responder nada. Aquí está adónde van los tokens y qué baja de verdad la cifra.

Un agente de código no envía tu pregunta. Envía tu pregunta más todo lo que decidió que querías decir: los archivos que abrió, los listados de directorios que recorrió, la salida de cada comando que ejecutó y toda la conversación hasta ahora, otra vez, en cada turno. La pregunta es un error de redondeo. El contexto que la rodea es la factura.

Por eso el consejo habitual, escribir prompts más cortos, no hace casi nada. Puedes reducir a la mitad tu mensaje y mover el total un uno por ciento. Los siete puntos siguientes están ordenados por lo que valen de verdad.

1. Di a qué archivo te refieres

El mayor coste evitable de una sesión de agente es la exploración: el agente leyendo hasta llegar al archivo que tú ya tenías abierto. Cada lectura, cada búsqueda y cada listado aterriza en el contexto y se queda ahí el resto de la sesión.

Nombrar el archivo convierte una búsqueda en un acceso directo. Vale más que cualquier opción, cualquier ajuste y cualquier técnica de redacción de prompts.

capsul ask 'por qué el bucle de reintento se rinde antes de tiempo' --open src/lib/retry.ts

El archivo entra entero. No hay que encontrar nada primero.

2. Abre una sesión nueva cuando cambie el tema

El historial de la conversación se reenvía entero en cada turno. Una sesión que lleva cuarenta mensajes paga los cuarenta en el mensaje cuarenta y uno, siga sirviendo algo de eso o no.

Así que el hábito más caro es el más natural: mantener una sesión larga abierta todo el día. Dos tareas sin relación en un mismo hilo significa que la segunda paga por la primera. Ciérrala y empieza de nuevo cuando cambie el tema.

3. Pon un techo al contexto

Un presupuesto es un techo duro sobre cuánto contexto puede pasar, expresado en tokens. No es una sugerencia que el agente pueda superar cuando se sienta poco informado.

capsul ask 'añade un límite de peticiones a la ruta de login' --budget 3000

Nada se desborda por encima del techo. Lo que quedó fuera se informa.

La cifra importa menos que el hecho de que exista. Un agente sin techo llenará la ventana que le den, porque nunca hay un motivo para que se detenga.

4. Ajusta el modelo a la tarea

Renombrar una variable y diseñar una migración no son el mismo trabajo, y no deberían correr en el mismo modelo. La mayoría de las sesiones corren enteras en el modelo más grande disponible porque es el valor por defecto, no porque alguien lo eligiera.

capsul ask 'renombra userId a accountId en todo el módulo de auth' --model haiku

5. Mantén la salida de las herramientas fuera del hilo

Una ejecución de pruebas que imprime dos mil líneas cuesta dos mil líneas de contexto, y sigue costándolas en cada turno posterior de esa sesión. Lo mismo con una compilación verbosa, un git log completo y un find sin filtrar.

Pasa lo ruidoso por algo que lo acorte antes de que el agente lo vea. head, grep, --quiet, --json con un filtro: todo eso sale más barato que pedirle al modelo que ignore el ruido.

6. Mide antes y después, no solo después

Cualquier afirmación sobre ahorro de tokens que no esté medida en la misma tarea y el mismo modelo es una suposición. Ejecuta lo que realmente haces, dos veces, y compara.

capsul context 'tu tarea real aquí' --json

Construye el contexto e informa de lo que cuesta, sin gastar una petición.

7. Mira la tendencia, no el turno

Una petición no dice nada. El consumo de tokens es irregular por naturaleza: un turno cargado de exploración puede costar diez veces uno de edición, y ambos son normales. Lo que quieres es la línea semanal.

capsul stats

Lo que no funciona

  • Pedirle brevedad al modelo. Los tokens de salida son una parte pequeña de la factura; el dinero está en la entrada.
  • Apagar las herramientas. Entonces el agente te pide que pegues el archivo, y pegas más de lo que necesitaba.
  • Pasar a una ventana de contexto más grande. Una ventana el doble de grande es una factura el doble de grande por la misma respuesta, no un ahorro.
  • Compactar la conversación tarde. Cuando se activa la compactación, ya has pagado todos los turnos que llevaron hasta ella.

Preguntas

¿Una ventana de contexto más grande sale más barata?

No, sale más cara. Se factura por token de entrada en cada petición, así que una ventana el doble de grande es una invitación a enviar el doble por la misma respuesta. La ventana es un techo, no una asignación.

¿Cuántos tokens consume un turno de Claude Code?

Depende casi por completo de cuánto exploró el agente, no de lo largo que fuera tu mensaje. Un turno que lee cuatro archivos y ejecuta una prueba puede costar decenas de miles de tokens de entrada; la misma pregunta con el archivo nombrado cuesta una fracción.

¿Importan los tokens de salida?

Mucho menos que los de entrada. Una respuesta larga son unos pocos miles de tokens. El contexto que la produjo suele ser diez o cien veces eso, y se reenvía en el turno siguiente mientras que la respuesta no.

¿Enviar menos empeora la respuesta?

Enviar menos no es enviar peor. El banco de capsul sigue las comprobaciones de respuesta junto a los recuentos de tokens precisamente para que un ahorro comprado con una respuesta incorrecta se vea tal cual. Algunas filas ganan un anclaje, otras lo pierden, y ambas se publican.

$ npm i -g @penra/capsul

Todas las guías