gpt-5.6-sol in Codex CLI: Tokens pro Frage

Sol ist das Spitzenmodell dieser GPT-Familie in Codex CLI und für anspruchsvolle Coding-Arbeit gedacht.

Die Messwerte

Codex CLI allein
33.100

cachegewichtete Eingabetokens pro Frage

Mit capsul
14.700

cachegewichtete Eingabetokens pro Frage

weniger gesendete Eingabe
x2.26

90-%-Intervall: x1.81 bis x3.01

bestandene Antwortprüfungen von fünf, ohne und mit capsul
3 / 3
Ausgabetokens pro Frage, ohne und mit capsul
1.020 / 225

Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.

Es kommt bei unklaren Fehlern, komplexen Implementierungen oder Reviews infrage, die anhaltendes Urteilsvermögen verlangen. Solche Aufgaben laden auch zu breiter Dateisuche ein. Deshalb zählt die vom Agenten gesendete Eingabe neben der Modellwahl. Die Zahlen unten vergleichen dieselben kurzen Fragen in Codex CLI allein und mit capsul.

Dieser Lauf nutzte ein ChatGPT-Abo. Die Seite zeigt deshalb Tokens und keinen Dollarbetrag je Frage. Prüfen Sie Intervall und Antwortprüfungen, bevor Sie aus der gemessenen Differenz eine Änderung Ihres Arbeitsablaufs ableiten. Ein langes Projekt kann Kontext anders ansammeln als diese kurzen Aufgaben.

Frage für Frage

Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.

FrageOhne capsulcapsulWeniger EingabeKorrekte Läufe, ohne / mit capsul
F136.00019.200x1.880 / 0
F223.9009.850x2.431 / 2
F324.6007.830x3.142 / 2
F461.40021.900x2.800 / 0
F519.40014.500x1.342 / 2

So wurde gemessen

Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.

20 / 20 cells · /benchmarks/2026-09-04-codex.json

Fragen

Wie viele Tokens nutzt gpt-5.6-sol pro Frage in Codex CLI?

Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.6-sol im Mittel 33.100 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 14.700.

Ist die Einsparung bei gpt-5.6-sol belegt?

Ja. Das 90-%-Intervall reicht von x1.81 bis x3.01 und liegt vollständig über eins, bei 20 gemessenen Zellen.

Verändert capsul die Antworten von gpt-5.6-sol?

In diesem Protokoll nicht: gpt-5.6-sol bestand 3 von fünf Antwortprüfungen ohne capsul und 3 von fünf mit capsul.