gpt-5.4 en Codex CLI: tokens por pregunta

Este modelo GPT anterior es otra referencia para las sesiones de código en Codex CLI.

Las cifras

Codex CLI solo
31.800

tokens de entrada ponderados por caché por pregunta

Con capsul
8220

tokens de entrada ponderados por caché por pregunta

menos entrada enviada
x3.86

Intervalo del 90 %: x2.88 a x5.47

respuestas correctas de cinco, sin y con capsul
4 / 4
tokens de salida por pregunta, sin y con capsul
1660 / 467

Codex CLI informa de tokens, no de dólares, con un plan ChatGPT: no se muestra ningún coste para los modelos GPT.

Un modelo conocido puede consumir cantidades de entrada muy distintas según cuánto lea el agente antes de responder. Las medidas de abajo mantienen constantes las preguntas de código y cambian cómo se proporciona el contexto. Así la fila permite juzgar el tráfico de tokens sin adivinarlo a partir del nombre del modelo.

No se ofrece una cifra en dólares por pregunta para esta ejecución con suscripción. Lee el intervalo con las comprobaciones de respuesta y las tareas individuales. Si usas este modelo para cambios grandes o conversaciones largas, la entrada acumulada en esas sesiones merece una medida propia.

Pregunta por pregunta

Cinco preguntas de una línea sobre un repositorio TypeScript real, cada una repetida 2 veces por brazo. Entrada ponderada por pregunta, media de las repeticiones.

PreguntaSin capsulcapsulMenos entradaRespuestas correctas, sin / con capsul
P136.80010.400x3.530 / 0
P230.6005970x5.122 / 2
P317.0003310x5.121 / 2
P456.00015.900x3.532 / 2
P518.5005520x3.352 / 2

Cómo se midió

Dos brazos con el mismo modelo: Codex CLI tal como se usa habitualmente y la misma pregunta a través de capsul. La unidad es la entrada ponderada por caché: tokens nuevos con peso completo, lecturas de caché a una décima parte. Campaña del 4 de septiembre de 2026, 2 repeticiones por pregunta y brazo.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Preguntas

¿Cuántos tokens usa gpt-5.4 por pregunta en Codex CLI?

En el banco de pruebas del 4 de septiembre de 2026, una sesión de Codex CLI sin capsul con gpt-5.4 envió una media de 31.800 tokens de entrada ponderados por caché por pregunta de código de una línea. Con capsul en el mismo modelo, 8220.

¿Está demostrado el ahorro en gpt-5.4?

Sí. El intervalo del 90 % va de x2.88 a x5.47, completamente por encima de uno, en 20 celdas medidas.

¿Cambia capsul las respuestas de gpt-5.4?

No en este protocolo: gpt-5.4 superó 4 de cinco comprobaciones de respuesta sin capsul y 4 de cinco con capsul.