gpt-5.4 in Codex CLI: Tokens pro Frage

Dieses frühere GPT-Modell ist ein weiterer Bezugspunkt für Coding-Sitzungen in Codex CLI.

Die Messwerte

Codex CLI allein
31.800

cachegewichtete Eingabetokens pro Frage

Mit capsul
8.220

cachegewichtete Eingabetokens pro Frage

weniger gesendete Eingabe
x3.86

90-%-Intervall: x2.88 bis x5.47

bestandene Antwortprüfungen von fünf, ohne und mit capsul
4 / 4
Ausgabetokens pro Frage, ohne und mit capsul
1.660 / 467

Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.

Auch ein vertrautes Modell kann sehr unterschiedliche Eingabemengen verbrauchen, je nachdem, wie viel der Agent vor der Antwort liest. Die Messungen unten halten die Coding-Fragen konstant und ändern die Bereitstellung des Kontexts. So lässt sich der Tokenverkehr beurteilen, ohne vom Modellnamen darauf zu schließen.

Für diesen Abolauf wird kein Dollarbetrag je Frage ausgewiesen. Lesen Sie das Intervall zusammen mit den Antwortprüfungen und den einzelnen Aufgaben. Wenn Sie dieses Modell für größere Änderungen oder längere Gespräche verwenden, verdient die dabei angesammelte Eingabe eine eigene Messung.

Frage für Frage

Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.

FrageOhne capsulcapsulWeniger EingabeKorrekte Läufe, ohne / mit capsul
F136.80010.400x3.530 / 0
F230.6005.970x5.122 / 2
F317.0003.310x5.121 / 2
F456.00015.900x3.532 / 2
F518.5005.520x3.352 / 2

So wurde gemessen

Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Fragen

Wie viele Tokens nutzt gpt-5.4 pro Frage in Codex CLI?

Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.4 im Mittel 31.800 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 8.220.

Ist die Einsparung bei gpt-5.4 belegt?

Ja. Das 90-%-Intervall reicht von x2.88 bis x5.47 und liegt vollständig über eins, bei 20 gemessenen Zellen.

Verändert capsul die Antworten von gpt-5.4?

In diesem Protokoll nicht: gpt-5.4 bestand 4 von fünf Antwortprüfungen ohne capsul und 4 von fünf mit capsul.