Les tokens de Codex CLI : les lire, puis les réduire
Codex vous dit ce qu'il a dépensé après coup. Voici comment le voir avant, et ce qui fait bouger le chiffre.
Une session Codex CLI a la forme de toute session d'agent : une petite question emballée dans beaucoup de contexte. La différence, c'est qu'une part notable de ce contexte est ambiante. Elle est là avant que vous ne tapiez quoi que ce soit.
L'entrée ambiante : la part que vous n'avez pas demandée
Chaque session commence par des instructions, des schémas d'outils et tout ce que l'environnement a enregistré. Rien de tout cela n'est faux, et tout est facturé à chaque tour, que la tâche en cours y touche ou non.
Cela se mesure sans consommer de quota, ce qui est rare et mérite d'être connu :
codex debug prompt-inputAffiche ce qui serait envoyé. Déterministe, reproductible, et gratuit.
Lancez-le sur votre machine et lisez le total. Sur notre machine de référence, la part ambiante que capsul retire dépassait quatre mille cinq cents tokens par tour : un catalogue de plugins, le mode d'emploi des connecteurs et les skills livrés, plus les schémas d'outils des serveurs MCP que Codex démarrait tout seul.
L'entrée de session : la part que vous maîtrisez
Par-dessus l'ambiant s'empile ce que tout agent accumule : les fichiers lus, les commandes lancées, et le fil jusqu'ici. Les leviers sont ceux qui marchent partout.
- Nommer le fichier plutôt que laisser l'agent le trouver.
- Une session par tâche, refermée quand la tâche est finie.
- Filtrer les sorties bruyantes avant qu'elles n'atteignent le fil.
- Poser un plafond sur le contexte et s'y tenir.
Faire tourner Codex sous un budget
capsul pilote le CLI Codex auquel vous êtes déjà connecté : c'est votre abonnement ChatGPT existant qui répond. La continuation, l'usage et l'effort de raisonnement vous sont rapportés là où vous pouvez les voir.
npm i -g @penra/capsulcapsul ask 'ajoute la pagination sur le point d'entrée de recherche' --budget 3000Lire les chiffres honnêtement
Deux réserves valables pour tout banc de tokens, le nôtre compris. D'abord, entrée pondérée et entrée brute sont deux mesures différentes : l'entrée en cache est facturée une fraction de l'entrée fraîche, donc une comparaison qui ignore le cache flatte celui des deux bras qui met le mieux en cache. Ensuite, une économie sur une tâche n'est pas une économie sur la suivante. Notre propre tableau comporte une ligne où capsul consomme plus d'entrée pondérée, et elle est publiée plutôt que retirée.
Questions
Comment voir la consommation de tokens de Codex sans dépenser de quota ?
codex debug prompt-input affiche ce qui serait envoyé pour une entrée donnée, sans appeler de modèle. C'est déterministe : on peut donc mesurer un changement en le lançant deux fois.
capsul a-t-il besoin d'une clé API OpenAI ?
Non. Il pilote le CLI Codex auquel vous êtes déjà connecté : c'est votre abonnement ChatGPT qui répond. Une clé API reste un choix facultatif par session, sur n'importe quel plan.
Réduire l'entrée change-t-il l'effort de raisonnement ?
Ce sont deux choses indépendantes. L'effort est un réglage à part, rapporté dans capsul à côté de l'usage, et réglable requête par requête.
Les serveurs MCP coûtent-ils des tokens même inutilisés ?
Leurs schémas d'outils font partie de ce qui est envoyé, donc oui : un serveur enregistré auquel la tâche en cours ne touche jamais occupe quand même de l'entrée à chaque tour.
$ npm i -g @penra/capsul