gpt-5.6-luna en Codex CLI: tokens por pregunta

Luna es el modelo eficiente de esta familia GPT para tareas de código concretas y repetibles.

Las cifras

Codex CLI solo
32.100

tokens de entrada ponderados por caché por pregunta

Con capsul
13.600

tokens de entrada ponderados por caché por pregunta

menos entrada enviada
x2.36

Intervalo del 90 %: x1.91 a x3.01

respuestas correctas de cinco, sin y con capsul
4 / 3
tokens de salida por pregunta, sin y con capsul
1180 / 295

Codex CLI informa de tokens, no de dólares, con un plan ChatGPT: no se muestra ningún coste para los modelos GPT.

Una referencia precisa a un archivo y una petición acotada le dan una oportunidad justa en búsquedas, cambios pequeños y pruebas sencillas. Una investigación amplia puede requerir un modelo más capaz o más exploración, y cualquiera de las dos cosas cambia el coste de la sesión. Por eso el banco pone las comprobaciones de respuesta junto a los tokens en lugar de considerar que una entrada baja es todo el resultado.

Esta ejecución de Codex CLI estaba cubierta por una suscripción ChatGPT y no informa de dólares por llamada. Compara su intervalo y las filas por pregunta con el trabajo que esperas repetir. Una diferencia en una pregunta no demuestra la misma diferencia en todo tu repositorio.

Pregunta por pregunta

Cinco preguntas de una línea sobre un repositorio TypeScript real, cada una repetida 2 veces por brazo. Entrada ponderada por pregunta, media de las repeticiones.

PreguntaSin capsulcapsulMenos entradaRespuestas correctas, sin / con capsul
P139.20013.300x2.962 / 0
P230.60014.500x2.112 / 2
P321.20012.700x1.662 / 2
P448.00019.800x2.430 / 0
P521.8007800x2.802 / 2

Cómo se midió

Dos brazos con el mismo modelo: Codex CLI tal como se usa habitualmente y la misma pregunta a través de capsul. La unidad es la entrada ponderada por caché: tokens nuevos con peso completo, lecturas de caché a una décima parte. Campaña del 4 de septiembre de 2026, 2 repeticiones por pregunta y brazo.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Preguntas

¿Cuántos tokens usa gpt-5.6-luna por pregunta en Codex CLI?

En el banco de pruebas del 4 de septiembre de 2026, una sesión de Codex CLI sin capsul con gpt-5.6-luna envió una media de 32.100 tokens de entrada ponderados por caché por pregunta de código de una línea. Con capsul en el mismo modelo, 13.600.

¿Está demostrado el ahorro en gpt-5.6-luna?

Sí. El intervalo del 90 % va de x1.91 a x3.01, completamente por encima de uno, en 20 celdas medidas.

¿Cambia capsul las respuestas de gpt-5.6-luna?

Superó menos: 4 de cinco sin capsul, 3 de cinco con capsul. El banco de pruebas publica este resultado en vez de omitirlo.