Claude Code frente a Codex CLI: consumo de tokens
El modelo, las herramientas y la tarea influyen más en el consumo que el nombre del agente. Aquí se explica qué envía cada uno, cómo informa del uso y qué mide la comparación.
Claude Code y Codex CLI son agentes de terminal que leen archivos, ejecutan comandos y editan código en un bucle. Gastan tokens de forma parecida: cada petición lleva mucho más que tu pregunta, y esta suele ser la parte más pequeña.
Ninguno usa siempre menos tokens. El modelo elegido, las instrucciones y herramientas activadas y la cantidad de exploración cambian más el total que la elección de agente.
Adónde van los tokens en ambos
Cada petición contiene tres capas de entrada:
- Entrada inicial: instrucciones del agente, herramientas disponibles, reglas del proyecto (
CLAUDE.mdoAGENTS.md) y skills, plugins o servidores MCP activados. Existe antes de escribir nada. - Exploración: lecturas de archivos, búsquedas y salidas de comandos que entran en la conversación y permanecen durante la sesión.
- Historial: conversación y resultados de herramientas anteriores, reenviados en cada petición. Una pregunta suele generar varias peticiones según los pasos del agente.
La caché de prompts abarata el historial repetido en ambos. A septiembre de 2026, la lectura cuesta una décima parte de la entrada nueva en la mayoría de modelos de Anthropic y en la tarifa correspondiente de OpenAI. Ambos agentes pueden resumir el historial al llenarse la ventana; /compact permite hacerlo a petición.
Qué cargan antes de la primera pregunta
Claude Code coloca primero instrucciones y herramientas, después CLAUDE.md, memoria y reglas, y al final la conversación. En modelos compatibles aplaza los esquemas MCP: un servidor inactivo aporta nombres e instrucciones, no todas sus definiciones. Cada skill aporta una descripción breve hasta que se invoca.
Codex CLI construye al arrancar una cadena de archivos AGENTS.md desde su directorio global y desde la raíz del proyecto hasta el directorio actual. Por defecto deja de añadirlos a los 32 KiB. Incluye un catálogo de skills cuyo presupuesto suele ser el 2 % de la ventana. Los servidores MCP de config.toml pueden aplazar sus definiciones si el modelo lo admite; enabled_tools y disabled_tools limitan qué herramientas se ofrecen.
Ninguna de esas capas tiene un tamaño fijo. Depende de lo instalado y configurado en tu equipo, por lo que el resultado de otra máquina no predice el tuyo.
Qué muestra cada agente
Claude Code informa del consumo en tokens y de un coste estimado en dólares:
/usageClaude Code: tokens por modelo, caché, coste estimado de API y uso del plan en una suscripción.
/contextClaude Code: ocupación actual de la ventana por categorías.
Codex CLI muestra tokens y, al iniciar sesión con ChatGPT, cuánto margen queda en los límites:
/statusCodex: modelo, contexto utilizado y restante, y límites de cinco horas y semanales.
codex debug prompt-input 'where is the retry limit set'Muestra como JSON la lista de entrada que Codex enviaría, sin llamar al modelo.
/usage en Codex muestra actividad por día, semana o total; al salir se imprimen los tokens de la sesión. debug prompt-input omite las instrucciones base y los esquemas de herramientas que viajan aparte, así que su cifra es un mínimo, no la petición completa.
Cómo cobra cada uno
Ambos pueden funcionar con suscripción o con facturación por token, pero los contadores difieren:
- Claude Code con Pro o Max: consume límites de sesión, que se reinician cada cinco horas, y límites semanales compartidos con Claude. Team y Enterprise también aplican límites. Los dólares de
/usageson una estimación a precio de API, no una factura de Pro o Max. - Claude Code con clave de API o Console: se cobra cada token según tarifas de API, incluidas lecturas y escrituras de caché. Una
ANTHROPIC_API_KEYdel entorno puede sustituir la suscripción tras aprobación;claude -pla usa sin preguntar. - Codex CLI con ChatGPT: consume el cupo del plan, expresado por OpenAI como mensajes locales aproximados en periodos de cinco horas y posibles límites semanales. Los créditos permiten continuar después. Plus y Pro muestran tokens y porcentajes, no dólares.
- Codex CLI con clave de API: se factura a la cuenta de OpenAI Platform según sus tarifas.
Qué midió nuestro banco de pruebas
Ejecutamos ambos agentes por separado, con claude -p y codex exec en su configuración habitual, sobre las mismas cinco preguntas breves de un repositorio. La unidad es entrada ponderada por caché por pregunta, sumada en todas las peticiones: entrada nueva completa, lecturas a una décima parte y escrituras con el recargo correspondiente. Cada fila representa un modelo.
Cada tabla muestra el agente solo, que es la cifra pertinente al comparar agentes, y la misma pregunta enviada con capsul y el mismo modelo. Las comprobaciones de respuesta indican cuántas de las cinco preguntas incluyeron el detalle esperado según una verificación automática.
| Modelo | Entrada, sin capsul | Entrada, con capsul | Coste, sin capsul | Coste, con capsul | Menos entrada |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | 55.500 | 19.300 | 0,0812 US$ | 0,0265 US$ | x2.88 |
| Claude Sonnet 5 | 54.200 | 18.900 | 0,153 US$ | 0,0487 US$ | x2.86 |
| Claude Sonnet 4.6 | 31.400 | 16.600 | 0,139 US$ | 0,0613 US$ | x1.89 |
| Claude Opus 4.6 | 45.700 | 16.400 | 0,332 US$ | 0,101 US$ | x2.78 |
| Claude Opus 4.7 | 38.700 | 20.100 | 0,28 US$ | 0,126 US$ | x1.92 |
| Claude Opus 4.8 | 65.800 | 13.800 | 0,498 US$ | 0,0825 US$ | x4.75 |
| Claude Opus 5 | 45.300 | 16.200 | 0,343 US$ | 0,101 US$ | x2.80 |
| Claude Opus 5.5 | 42.300 | 15.900 | 0,222 US$ | 0,0696 US$ | x2.66 |
| Claude Fable 5 | 41.400 | 17.600 | 0,633 US$ | 0,219 US$ | x2.35 |
| Claude Fable 5.1 | 49.700 | 23.400 | 0,636 US$ | 0,279 US$ | x2.12 |
La tabla de Claude añade el coste por pregunta que Claude Code calcula a precios públicos de API. Con una suscripción no pagas esa cifra.
| Modelo | Entrada, sin capsul | Entrada, con capsul | Menos entrada |
|---|---|---|---|
| gpt-5.6-sol | 33.100 | 14.700 | x2.26 |
| gpt-5.6-terra | 24.000 | 11.100 | x2.16 |
| gpt-5.6-luna | 32.100 | 13.600 | x2.36 |
| gpt-5.5 | 47.200 | 8130 | x5.81 |
| gpt-5.4 | 31.800 | 8220 | x3.86 |
| gpt-5.4-mini | 42.300 | 12.100 | x3.49 |
La tabla de Codex no muestra dólares: las pruebas usaron un plan ChatGPT, en el que Codex informa de tokens y límites, no de una factura por petición.
Por qué las tablas no son una clasificación
Al leerlas juntas hay que tener presentes cinco diferencias:
- Fechas y código: Claude se midió el 22 de septiembre de 2026 y la campaña principal de Codex el 4, con las versiones de agente y capsul de cada día.
- Modelos: ninguno figura en ambas tablas, así que comparar agentes también implica comparar modelos.
- Tokenizadores: cada proveedor divide el texto de otro modo. Anthropic indica que sus modelos nuevos cuentan cerca de un 30 % más de tokens que los anteriores para el mismo texto.
- Contadores: Claude informa de escrituras de caché, ponderadas por encima de la entrada nueva. Las ejecuciones de Codex no informaron de ellas y los créditos de ChatGPT no tienen ese cargo separado.
- Repeticiones: cada pregunta en Claude se ejecutó tres veces por variante y en Codex, dos; la primera escribe la caché que leen las siguientes.
Aun con esas reservas, aparece un patrón útil: ambos agentes solos pueden enviar decenas de miles de tokens de entrada ponderada para una pregunta de una línea. Casi todo es contexto. Dentro de cada tabla, la diferencia entre modelos es amplia: elegir modelo mueve la cifra tanto o más que elegir agente.
Qué hacer con esta comparación
Si ya pagas uno de los dos planes, cambiar de agente rara vez es la primera forma de ahorrar tokens. Estas medidas funcionan en ambos:
- Abre una sesión nueva por tarea.
/cleardetiene el reenvío del historial anterior en ambos. - Nombra el archivo necesario: la exploración es la capa más variable.
- Mantén corta la entrada inicial: CLAUDE.md o AGENTS.md breves y sin servidores MCP ni plugins que no uses.
- Ajusta modelo y esfuerzo a la tarea:
/modely/efforten Claude Code;/modelen Codex cuando el modelo lo permita.
Para comparar en tu código, define una tarea real y ejecútala varias veces por agente en sesiones nuevas del mismo repositorio. Con claude -p --output-format json, suma entrada, lecturas y escrituras por modelo, incluidos subagentes; el campo usage simple no los incluye. Con codex exec --json, toma el uso del último evento turn.completed y separa la parte cacheada. Pondera entradas nuevas, lecturas y escrituras según su tarifa y obtendrás el coste en tokens por tarea de cada agente en tu trabajo.
Si usas ambos, capsul puede iniciar cualquiera desde el mismo comando con un presupuesto de tokens y conservar un registro local de consumo.
capsul burnConsumo local desglosado por agente, modelo y proyecto.
Preguntas
¿Claude Code o Codex CLI usa menos tokens?
Ninguno de forma fiable. El modelo, las instrucciones y herramientas activas, y cuánto explora el agente suelen importar más. Además, cada proveedor tokeniza de otra manera. En nuestras pruebas, la diferencia entre modelos del mismo agente fue al menos tan amplia como la diferencia entre agentes.
¿Codex CLI es más barato que Claude Code?
Con suscripción pagas el plan y cambia cuánto tarda en agotarse su límite. Con clave de API, cada proveedor factura tokens a sus precios, con descuento para lecturas de caché. El agente más barato para ti será el que complete tus tareas con menos contexto y un modelo adecuado; mídelo en tu propio código.
¿Por qué Claude Code muestra dólares si pago Pro o Max?
/usage estima cuánto costarían los tokens de la sesión a precios públicos de API. Anthropic aclara que esa cifra no determina la facturación de Pro o Max. En la misma pantalla aparecen las barras de consumo que sí importan para tu plan.
¿Cómo veo los tokens usados por Codex CLI con ChatGPT?
/status muestra ventana usada y restante y margen de los límites de cinco horas y semanales. /usage muestra actividad de la cuenta por día o semana. Al salir se imprimen los tokens de la sesión, con la entrada cacheada indicada por separado.
¿Puedo comparar los recuentos que muestran ambos agentes?
No tal como aparecen. Claude separa entrada nueva, lecturas y escrituras; el input_tokens del JSON de Codex ya incluye entrada cacheada. Convierte ambos a entrada ponderada por caché y repite la misma tarea varias veces en cada agente.
$ npm i -g @penra/capsul