gpt-5.5 in Codex CLI: Tokens pro Frage
Diese frühere GPT-Version bietet Codex-CLI-Nutzern einen Bezugspunkt gegenüber den neueren Familienvarianten.
Die Messwerte
- Codex CLI allein
- 47.200
- Mit capsul
- 8.130
- weniger gesendete Eingabe
- x5.81
- bestandene Antwortprüfungen von fünf, ohne und mit capsul
- 4 / 4
- Ausgabetokens pro Frage, ohne und mit capsul
- 1.500 / 81,2
cachegewichtete Eingabetokens pro Frage
cachegewichtete Eingabetokens pro Frage
90-%-Intervall: x4.29 bis x7.89
Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.
Die Modellwahl beeinflusst, wie ein Agent eine Coding-Frage angeht. Der umgebende Kontext bleibt aber Teil jeder Anfrage. Diese Zeile zeigt die Eingabe von Codex CLI allein und derselben Aufgabe mit capsul. Sie ist besonders nützlich, wenn dieses Modell bereits in Ihrer täglichen Umgebung verfügbar ist.
Der Benchmark erfasst Tokens und Antwortprüfungen, keine Dollarrechnung für ein ChatGPT-Abo. Vergleichen Sie die Aufgabenzeilen, bevor Sie eine Differenz dem Alter oder der Stufe des Modells zuschreiben. Die Beobachtungen betreffen kurze Fragen unter einem festen Protokoll und nicht jede längere Sitzung.
Frage für Frage
Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.
| Frage | Ohne capsul | capsul | Weniger Eingabe | Korrekte Läufe, ohne / mit capsul |
|---|---|---|---|---|
| F1 | 63.800 | 8.500 | x7.50 | 0 / 0 |
| F2 | 40.900 | 12.300 | x3.31 | 2 / 2 |
| F3 | 21.500 | 3.700 | x5.79 | 2 / 2 |
| F4 | 83.000 | 10.200 | x8.13 | 2 / 2 |
| F5 | 27.000 | 5.910 | x4.56 | 2 / 2 |
So wurde gemessen
Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.
20 / 20 cells · /benchmarks/2026-09-04-codex.json
Fragen
Wie viele Tokens nutzt gpt-5.5 pro Frage in Codex CLI?
Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.5 im Mittel 47.200 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 8.130.
Ist die Einsparung bei gpt-5.5 belegt?
Ja. Das 90-%-Intervall reicht von x4.29 bis x7.89 und liegt vollständig über eins, bei 20 gemessenen Zellen.
Verändert capsul die Antworten von gpt-5.5?
In diesem Protokoll nicht: gpt-5.5 bestand 4 von fünf Antwortprüfungen ohne capsul und 4 von fünf mit capsul.