gpt-5.4 in Codex CLI: Tokens pro Frage
Dieses frühere GPT-Modell ist ein weiterer Bezugspunkt für Coding-Sitzungen in Codex CLI.
Die Messwerte
- Codex CLI allein
- 31.800
- Mit capsul
- 8.220
- weniger gesendete Eingabe
- x3.86
- bestandene Antwortprüfungen von fünf, ohne und mit capsul
- 4 / 4
- Ausgabetokens pro Frage, ohne und mit capsul
- 1.660 / 467
cachegewichtete Eingabetokens pro Frage
cachegewichtete Eingabetokens pro Frage
90-%-Intervall: x2.88 bis x5.47
Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.
Auch ein vertrautes Modell kann sehr unterschiedliche Eingabemengen verbrauchen, je nachdem, wie viel der Agent vor der Antwort liest. Die Messungen unten halten die Coding-Fragen konstant und ändern die Bereitstellung des Kontexts. So lässt sich der Tokenverkehr beurteilen, ohne vom Modellnamen darauf zu schließen.
Für diesen Abolauf wird kein Dollarbetrag je Frage ausgewiesen. Lesen Sie das Intervall zusammen mit den Antwortprüfungen und den einzelnen Aufgaben. Wenn Sie dieses Modell für größere Änderungen oder längere Gespräche verwenden, verdient die dabei angesammelte Eingabe eine eigene Messung.
Frage für Frage
Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.
| Frage | Ohne capsul | capsul | Weniger Eingabe | Korrekte Läufe, ohne / mit capsul |
|---|---|---|---|---|
| F1 | 36.800 | 10.400 | x3.53 | 0 / 0 |
| F2 | 30.600 | 5.970 | x5.12 | 2 / 2 |
| F3 | 17.000 | 3.310 | x5.12 | 1 / 2 |
| F4 | 56.000 | 15.900 | x3.53 | 2 / 2 |
| F5 | 18.500 | 5.520 | x3.35 | 2 / 2 |
So wurde gemessen
Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.
20 / 20 cells · /benchmarks/2026-09-04-codex.json
Fragen
Wie viele Tokens nutzt gpt-5.4 pro Frage in Codex CLI?
Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.4 im Mittel 31.800 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 8.220.
Ist die Einsparung bei gpt-5.4 belegt?
Ja. Das 90-%-Intervall reicht von x2.88 bis x5.47 und liegt vollständig über eins, bei 20 gemessenen Zellen.
Verändert capsul die Antworten von gpt-5.4?
In diesem Protokoll nicht: gpt-5.4 bestand 4 von fünf Antwortprüfungen ohne capsul und 4 von fünf mit capsul.