gpt-5.4-mini en Codex CLI: tokens por pregunta

Mini es el modelo más pequeño de esta familia GPT anterior, adecuado para tareas de código bien delimitadas.

Las cifras

Codex CLI solo
42.300

tokens de entrada ponderados por caché por pregunta

Con capsul
12.100

tokens de entrada ponderados por caché por pregunta

menos entrada enviada
x3.49

Intervalo del 90 %: x3.05 a x4.03

respuestas correctas de cinco, sin y con capsul
3 / 4
tokens de salida por pregunta, sin y con capsul
2390 / 904

Codex CLI informa de tokens, no de dólares, con un plan ChatGPT: no se muestra ningún coste para los modelos GPT.

Puede servir para localizar código, hacer un cambio mecánico o revisar el fallo de una prueba concreta. Un modelo pequeño no es automáticamente la vía más barata hacia una respuesta correcta si necesita nuevos intentos o más exploración. Por eso las comprobaciones de respuesta figuran junto al recuento de tokens.

Codex CLI usó una suscripción ChatGPT en esta ejecución, así que la página no convierte los tokens en dólares. Las preguntas individuales muestran dónde resolvió la tarea y dónde no. Léelas con el intervalo antes de extender el resultado medido a tu propio trabajo.

Pregunta por pregunta

Cinco preguntas de una línea sobre un repositorio TypeScript real, cada una repetida 2 veces por brazo. Entrada ponderada por pregunta, media de las repeticiones.

PreguntaSin capsulcapsulMenos entradaRespuestas correctas, sin / con capsul
P145.70011.500x3.971 / 0
P235.60021.800x1.632 / 2
P379207110x1.110 / 2
P481.20010.400x7.780 / 2
P541.2009770x4.222 / 2

Cómo se midió

Dos brazos con el mismo modelo: Codex CLI tal como se usa habitualmente y la misma pregunta a través de capsul. La unidad es la entrada ponderada por caché: tokens nuevos con peso completo, lecturas de caché a una décima parte. Campaña del 4 de septiembre de 2026, 2 repeticiones por pregunta y brazo.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Preguntas

¿Cuántos tokens usa gpt-5.4-mini por pregunta en Codex CLI?

En el banco de pruebas del 4 de septiembre de 2026, una sesión de Codex CLI sin capsul con gpt-5.4-mini envió una media de 42.300 tokens de entrada ponderados por caché por pregunta de código de una línea. Con capsul en el mismo modelo, 12.100.

¿Está demostrado el ahorro en gpt-5.4-mini?

Sí. El intervalo del 90 % va de x3.05 a x4.03, completamente por encima de uno, en 20 celdas medidas.

¿Cambia capsul las respuestas de gpt-5.4-mini?

Superó más: 3 de cinco sin capsul, 4 de cinco con capsul. Cinco comprobaciones son una muestra pequeña: indica que no hubo pérdida, no que se haya demostrado una mejora.