gpt-5.6-luna en Codex CLI: tokens por pregunta
Luna es el modelo eficiente de esta familia GPT para tareas de código concretas y repetibles.
Las cifras
- Codex CLI solo
- 32.100
- Con capsul
- 13.600
- menos entrada enviada
- x2.36
- respuestas correctas de cinco, sin y con capsul
- 4 / 3
- tokens de salida por pregunta, sin y con capsul
- 1180 / 295
tokens de entrada ponderados por caché por pregunta
tokens de entrada ponderados por caché por pregunta
Intervalo del 90 %: x1.91 a x3.01
Codex CLI informa de tokens, no de dólares, con un plan ChatGPT: no se muestra ningún coste para los modelos GPT.
Una referencia precisa a un archivo y una petición acotada le dan una oportunidad justa en búsquedas, cambios pequeños y pruebas sencillas. Una investigación amplia puede requerir un modelo más capaz o más exploración, y cualquiera de las dos cosas cambia el coste de la sesión. Por eso el banco pone las comprobaciones de respuesta junto a los tokens en lugar de considerar que una entrada baja es todo el resultado.
Esta ejecución de Codex CLI estaba cubierta por una suscripción ChatGPT y no informa de dólares por llamada. Compara su intervalo y las filas por pregunta con el trabajo que esperas repetir. Una diferencia en una pregunta no demuestra la misma diferencia en todo tu repositorio.
Pregunta por pregunta
Cinco preguntas de una línea sobre un repositorio TypeScript real, cada una repetida 2 veces por brazo. Entrada ponderada por pregunta, media de las repeticiones.
| Pregunta | Sin capsul | capsul | Menos entrada | Respuestas correctas, sin / con capsul |
|---|---|---|---|---|
| P1 | 39.200 | 13.300 | x2.96 | 2 / 0 |
| P2 | 30.600 | 14.500 | x2.11 | 2 / 2 |
| P3 | 21.200 | 12.700 | x1.66 | 2 / 2 |
| P4 | 48.000 | 19.800 | x2.43 | 0 / 0 |
| P5 | 21.800 | 7800 | x2.80 | 2 / 2 |
Cómo se midió
Dos brazos con el mismo modelo: Codex CLI tal como se usa habitualmente y la misma pregunta a través de capsul. La unidad es la entrada ponderada por caché: tokens nuevos con peso completo, lecturas de caché a una décima parte. Campaña del 4 de septiembre de 2026, 2 repeticiones por pregunta y brazo.
20 / 20 cells · /benchmarks/2026-09-04-codex.json
Preguntas
¿Cuántos tokens usa gpt-5.6-luna por pregunta en Codex CLI?
En el banco de pruebas del 4 de septiembre de 2026, una sesión de Codex CLI sin capsul con gpt-5.6-luna envió una media de 32.100 tokens de entrada ponderados por caché por pregunta de código de una línea. Con capsul en el mismo modelo, 13.600.
¿Está demostrado el ahorro en gpt-5.6-luna?
Sí. El intervalo del 90 % va de x1.91 a x3.01, completamente por encima de uno, en 20 celdas medidas.
¿Cambia capsul las respuestas de gpt-5.6-luna?
Superó menos: 4 de cinco sin capsul, 3 de cinco con capsul. El banco de pruebas publica este resultado en vez de omitirlo.