gpt-5.6-luna in Codex CLI: Tokens pro Frage

Luna ist das effiziente Modell dieser GPT-Familie für gezielte, wiederholbare Coding-Aufgaben.

Die Messwerte

Codex CLI allein
32.100

cachegewichtete Eingabetokens pro Frage

Mit capsul
13.600

cachegewichtete Eingabetokens pro Frage

weniger gesendete Eingabe
x2.36

90-%-Intervall: x1.91 bis x3.01

bestandene Antwortprüfungen von fünf, ohne und mit capsul
4 / 3
Ausgabetokens pro Frage, ohne und mit capsul
1.180 / 295

Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.

Ein präziser Dateiverweis und eine eng gefasste Bitte geben dieser Stufe eine faire Chance bei Suchen, kleinen Änderungen und einfachen Tests. Eine breite Untersuchung kann ein stärkeres Modell oder mehr Erkundung erfordern, was die Sitzung verteuert. Der Benchmark stellt deshalb den Tokenverbrauch neben die Antwortprüfungen, statt eine geringe Eingabe als vollständiges Ergebnis zu behandeln.

Dieser Codex-CLI-Lauf war von einem ChatGPT-Abo gedeckt und weist keine Dollarkosten je Aufruf aus. Vergleichen Sie Intervall und Aufgabenzeilen mit der Arbeit, die Sie regelmäßig erledigen wollen. Eine Differenz bei einer Frage belegt nicht dieselbe Differenz für Ihre gesamte Codebasis.

Frage für Frage

Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.

FrageOhne capsulcapsulWeniger EingabeKorrekte Läufe, ohne / mit capsul
F139.20013.300x2.962 / 0
F230.60014.500x2.112 / 2
F321.20012.700x1.662 / 2
F448.00019.800x2.430 / 0
F521.8007.800x2.802 / 2

So wurde gemessen

Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Fragen

Wie viele Tokens nutzt gpt-5.6-luna pro Frage in Codex CLI?

Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.6-luna im Mittel 32.100 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 13.600.

Ist die Einsparung bei gpt-5.6-luna belegt?

Ja. Das 90-%-Intervall reicht von x1.91 bis x3.01 und liegt vollständig über eins, bei 20 gemessenen Zellen.

Verändert capsul die Antworten von gpt-5.6-luna?

Es bestand weniger Prüfungen: 4 von fünf ohne capsul, 3 von fünf mit capsul. Der Benchmark veröffentlicht dieses Ergebnis, statt es auszulassen.