gpt-5.5 in Codex CLI: Tokens pro Frage

Diese frühere GPT-Version bietet Codex-CLI-Nutzern einen Bezugspunkt gegenüber den neueren Familienvarianten.

Die Messwerte

Codex CLI allein
47.200

cachegewichtete Eingabetokens pro Frage

Mit capsul
8.130

cachegewichtete Eingabetokens pro Frage

weniger gesendete Eingabe
x5.81

90-%-Intervall: x4.29 bis x7.89

bestandene Antwortprüfungen von fünf, ohne und mit capsul
4 / 4
Ausgabetokens pro Frage, ohne und mit capsul
1.500 / 81,2

Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.

Die Modellwahl beeinflusst, wie ein Agent eine Coding-Frage angeht. Der umgebende Kontext bleibt aber Teil jeder Anfrage. Diese Zeile zeigt die Eingabe von Codex CLI allein und derselben Aufgabe mit capsul. Sie ist besonders nützlich, wenn dieses Modell bereits in Ihrer täglichen Umgebung verfügbar ist.

Der Benchmark erfasst Tokens und Antwortprüfungen, keine Dollarrechnung für ein ChatGPT-Abo. Vergleichen Sie die Aufgabenzeilen, bevor Sie eine Differenz dem Alter oder der Stufe des Modells zuschreiben. Die Beobachtungen betreffen kurze Fragen unter einem festen Protokoll und nicht jede längere Sitzung.

Frage für Frage

Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.

FrageOhne capsulcapsulWeniger EingabeKorrekte Läufe, ohne / mit capsul
F163.8008.500x7.500 / 0
F240.90012.300x3.312 / 2
F321.5003.700x5.792 / 2
F483.00010.200x8.132 / 2
F527.0005.910x4.562 / 2

So wurde gemessen

Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Fragen

Wie viele Tokens nutzt gpt-5.5 pro Frage in Codex CLI?

Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.5 im Mittel 47.200 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 8.130.

Ist die Einsparung bei gpt-5.5 belegt?

Ja. Das 90-%-Intervall reicht von x4.29 bis x7.89 und liegt vollständig über eins, bei 20 gemessenen Zellen.

Verändert capsul die Antworten von gpt-5.5?

In diesem Protokoll nicht: gpt-5.5 bestand 4 von fünf Antwortprüfungen ohne capsul und 4 von fünf mit capsul.