Comment réduire les tokens consommés par Claude Code

Claude Code dépense l'essentiel de son budget avant même de répondre. Voici où partent les tokens, et ce qui fait vraiment baisser le compteur.

Un agent de code n'envoie pas votre question. Il envoie votre question, plus tout ce qu'il a décidé que vous vouliez dire : les fichiers ouverts, les listages de répertoires parcourus, la sortie de chaque commande lancée, et toute la conversation jusqu'ici, à nouveau, à chaque tour. La question est une poussière. Le contexte autour, c'est la facture.

C'est pourquoi le conseil habituel, écrire des prompts plus courts, ne change presque rien. Vous pouvez diviser votre message par deux et faire bouger le total de un pour cent. Les sept points ci-dessous sont classés par ce qu'ils valent réellement.

1. Dites quel fichier vous voulez dire

Le plus gros coût évitable d'une session d'agent, c'est l'exploration : l'agent qui lit son chemin jusqu'au fichier que vous aviez déjà sous les yeux. Chaque lecture, chaque recherche, chaque listage atterrit dans le contexte et y reste pour le reste de la session.

Nommer le fichier transforme une recherche en un accès direct. Cela vaut plus que n'importe quelle option, n'importe quel réglage et n'importe quelle technique de rédaction de prompt.

capsul ask 'pourquoi la boucle de reprise abandonne trop tôt' --open src/lib/retry.ts

Le fichier part en entier. Il n'y a plus rien à trouver d'abord.

2. Ouvrez une session neuve quand le sujet change

L'historique de conversation est renvoyé en entier à chaque tour. Une session ouverte depuis quarante messages paie les quarante au message quarante et un, que tout cela serve encore ou non.

L'habitude la plus coûteuse est donc la plus naturelle : garder une longue session ouverte toute la journée. Deux tâches sans rapport dans le même fil, c'est la seconde qui paie pour la première. Fermez et repartez quand le sujet change.

3. Posez un plafond sur le contexte

Un budget est un plafond dur sur ce qui a le droit de passer, exprimé en tokens. Ce n'est pas une suggestion que l'agent pourra dépasser quand il se sentira mal informé.

capsul ask 'ajoute une limitation de débit sur la route de connexion' --budget 3000

Rien ne déborde du plafond. Ce qui a été laissé de côté est annoncé.

Le chiffre compte moins que le fait qu'il existe. Un agent sans plafond remplira la fenêtre qu'on lui donne, parce que rien en lui ne décide jamais qu'il en sait assez.

4. Adaptez le modèle à la tâche

Renommer une variable et concevoir une migration ne sont pas le même travail, et ne devraient pas tourner sur le même modèle. La plupart des sessions tournent entièrement sur le plus gros modèle disponible parce que c'est le défaut, pas parce que quelqu'un l'a choisi.

capsul ask 'renomme userId en accountId dans tout le module auth' --model haiku

5. Gardez la sortie des outils hors du fil

Une exécution de tests qui affiche deux mille lignes coûte deux mille lignes de contexte, et continue de les coûter à chaque tour suivant de la session. Idem pour une compilation bavarde, un git log complet, un find sans filtre.

Faites passer ce qui est bruyant par quelque chose qui l'abrège avant que l'agent ne le voie. head, grep, --quiet, --json avec un filtre : tout cela coûte moins cher que de demander au modèle d'ignorer le bruit.

6. Mesurez avant et après, pas seulement après

Toute affirmation d'économie de tokens qui n'est pas mesurée sur la même tâche et le même modèle est une supposition. Lancez ce que vous faites vraiment, deux fois, et comparez.

capsul context 'votre vraie tâche ici' --json

Construit le contexte et annonce ce qu'il coûte, sans dépenser une requête.

7. Regardez la tendance, pas le tour

Une requête ne dit rien. La consommation de tokens est irrégulière par nature : un tour d'exploration peut coûter dix fois un tour d'édition, et les deux sont normaux. Ce qu'il faut regarder, c'est la courbe de la semaine.

capsul stats

Ce qui ne marche pas

  • Demander au modèle d'être bref. Les tokens de sortie sont une petite part de la facture ; c'est l'entrée qui coûte.
  • Couper les outils. L'agent vous demande alors de coller le fichier, et vous en collez plus qu'il n'en fallait.
  • Passer à une fenêtre de contexte plus grande. Une fenêtre deux fois plus grande est une facture deux fois plus grande pour la même réponse, pas une économie.
  • Compacter la conversation tardivement. Quand le compactage se déclenche, vous avez déjà payé chaque tour qui y a mené.

Questions

Une fenêtre de contexte plus grande, cela coûte moins cher ?

Non, cela coûte plus cher. Vous êtes facturé par token d'entrée à chaque requête : une fenêtre deux fois plus grande est une invitation à envoyer deux fois plus pour la même réponse. La fenêtre est un plafond, pas une allocation.

Combien de tokens consomme un tour de Claude Code ?

Cela dépend presque entièrement de ce que l'agent a exploré, pas de la longueur de votre message. Un tour qui lit quatre fichiers et lance des tests peut coûter des dizaines de milliers de tokens d'entrée ; la même question avec le fichier nommé en coûte une fraction.

Les tokens de sortie comptent-ils ?

Bien moins que ceux d'entrée. Une longue réponse fait quelques milliers de tokens. Le contexte qui l'a produite en fait souvent dix à cent fois plus, et il est renvoyé au tour suivant alors que la réponse ne l'est pas.

Envoyer moins dégrade-t-il la réponse ?

Envoyer moins n'est pas envoyer moins bien. Le banc de capsul suit les vérifications de réponse à côté des comptages de tokens, précisément pour qu'une économie payée d'une réponse fausse se voie pour ce qu'elle est. Certaines lignes gagnent un ancrage, d'autres en perdent un, et les deux sont publiées.

$ npm i -g @penra/capsul

Tous les guides