Tokens de Codex CLI: leerlos y luego reducirlos
Codex te dice lo que gastó después. Aquí está cómo verlo antes, y qué mueve la cifra.
Las sesiones de Codex CLI tienen la misma forma que cualquier sesión de agente: una pregunta pequeña envuelta en mucho contexto. La diferencia es que una parte apreciable de ese contexto es ambiental. Está ahí antes de que escribas nada.
Entrada ambiental: la parte que no pediste
Cada sesión arranca con instrucciones, esquemas de herramientas y lo que el entorno haya registrado. Nada de eso está mal, y todo se factura en cada turno, toque o no la tarea actual alguna de esas cosas.
Esto se puede medir sin gastar cuota, lo cual es inusual y conviene saberlo:
codex debug prompt-inputImprime lo que se enviaría. Determinista, repetible y no cuesta nada.
Ejecútalo en tu máquina y lee el total. En nuestra máquina de referencia, la parte ambiental que capsul retira superaba los cuatro mil quinientos tokens por turno: un catálogo de plugins, las instrucciones de los conectores y las skills incluidas, más los esquemas de herramientas de los servidores MCP que Codex arrancaba por su cuenta.
Entrada de sesión: la parte que controlas
Sobre la entrada ambiental se apila lo que todo agente acumula: archivos leídos, comandos ejecutados y el hilo hasta ahora. Las palancas son las que funcionan en todas partes.
- Nombrar el archivo en vez de dejar que el agente lo encuentre.
- Una sesión por tarea, cerrada cuando la tarea termina.
- Filtrar las salidas ruidosas antes de que lleguen al hilo.
- Poner un techo al contexto y mantenerlo.
Ejecutar Codex con presupuesto
capsul conduce la CLI de Codex en la que ya has iniciado sesión, así que responde tu plan de ChatGPT existente. La continuación, el uso y el esfuerzo de razonamiento se te devuelven donde puedes verlos.
npm i -g @penra/capsulcapsul ask 'añade paginación al endpoint de búsqueda' --budget 3000Leer las cifras con honestidad
Dos advertencias válidas para cualquier banco de tokens, el nuestro incluido. Primera: entrada ponderada y entrada en bruto son mediciones distintas, porque la entrada en caché se factura a una fracción de la entrada nueva, así que una comparación que ignore la caché favorece al brazo que mejor cachea. Segunda: un ahorro en una tarea no es un ahorro en la siguiente. Nuestra propia tabla tiene una fila donde capsul usa más entrada ponderada, y se publica en lugar de retirarse.
Preguntas
¿Cómo veo el consumo de tokens de Codex sin gastar cuota?
codex debug prompt-input imprime lo que se enviaría para una entrada dada sin llamar a ningún modelo. Es determinista, así que puedes medir un cambio ejecutándolo dos veces.
¿capsul necesita una clave de API de OpenAI?
No. Conduce la CLI de Codex en la que ya has iniciado sesión, así que responde tu plan de ChatGPT. Una clave de API es una opción por sesión en cualquier plan.
¿Reducir la entrada cambia el esfuerzo de razonamiento?
Son independientes. El esfuerzo es un ajuste aparte, devuelto a capsul junto al uso, y puedes fijarlo por petición.
¿Los servidores MCP cuestan tokens aunque no se usen?
Sus esquemas de herramientas forman parte de lo que se envía, así que sí: un servidor registrado que la tarea actual nunca toca sigue ocupando entrada en cada turno.
$ npm i -g @penra/capsul