gpt-5.4-mini in Codex CLI: Tokens pro Frage
Mini ist das kleinere Modell dieser früheren GPT-Familie und eignet sich für klar umrissene Coding-Arbeit.
Die Messwerte
- Codex CLI allein
- 42.300
- Mit capsul
- 12.100
- weniger gesendete Eingabe
- x3.49
- bestandene Antwortprüfungen von fünf, ohne und mit capsul
- 3 / 4
- Ausgabetokens pro Frage, ohne und mit capsul
- 2.390 / 904
cachegewichtete Eingabetokens pro Frage
cachegewichtete Eingabetokens pro Frage
90-%-Intervall: x3.05 bis x4.03
Codex CLI meldet bei einem ChatGPT-Abo Tokens, keine Dollarbeträge: Für GPT-Modelle werden keine Kosten gezeigt.
Es kommt infrage, um Code zu finden, eine mechanische Änderung vorzunehmen oder einen eng begrenzten Testfehler zu prüfen. Ein kleineres Modell ist nicht automatisch der günstigste Weg zu einer korrekten Antwort, wenn es weitere Versuche oder mehr Erkundung braucht. Deshalb stehen die Antwortprüfungen neben der Tokenzahl.
Codex CLI nutzte bei diesem Lauf ein ChatGPT-Abo. Die Seite rechnet Tokens daher nicht in Dollar um. Die einzelnen Fragen zeigen, wo das Modell die Aufgabe löste und wo nicht. Lesen Sie sie mit dem Intervall, bevor Sie das gemessene Ergebnis auf Ihren Ablauf übertragen.
Frage für Frage
Fünf einzeilige Fragen zu einem echten TypeScript-Projekt, je 2 Mal pro Arm gestellt. Gewichtete Eingabe pro Frage als Mittelwert der Wiederholungen.
| Frage | Ohne capsul | capsul | Weniger Eingabe | Korrekte Läufe, ohne / mit capsul |
|---|---|---|---|---|
| F1 | 45.700 | 11.500 | x3.97 | 1 / 0 |
| F2 | 35.600 | 21.800 | x1.63 | 2 / 2 |
| F3 | 7.920 | 7.110 | x1.11 | 0 / 2 |
| F4 | 81.200 | 10.400 | x7.78 | 0 / 2 |
| F5 | 41.200 | 9.770 | x4.22 | 2 / 2 |
So wurde gemessen
Zwei Arme mit demselben Modell: Codex CLI im normalen Einsatz und dieselbe Frage über capsul. Die Einheit ist cachegewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesezugriffe mit einem Zehntel. Kampagne vom 4. September 2026, 2 Wiederholungen je Frage und Arm.
20 / 20 cells · /benchmarks/2026-09-04-codex.json
Fragen
Wie viele Tokens nutzt gpt-5.4-mini pro Frage in Codex CLI?
Im Benchmark vom 4. September 2026 sendete eine Codex CLI-Sitzung ohne capsul mit gpt-5.4-mini im Mittel 42.300 cachegewichtete Eingabetokens pro einzeiliger Coding-Frage. Mit capsul auf demselben Modell waren es 12.100.
Ist die Einsparung bei gpt-5.4-mini belegt?
Ja. Das 90-%-Intervall reicht von x3.05 bis x4.03 und liegt vollständig über eins, bei 20 gemessenen Zellen.
Verändert capsul die Antworten von gpt-5.4-mini?
Es bestand mehr Prüfungen: 3 von fünf ohne capsul, 4 von fünf mit capsul. Fünf Prüfungen sind eine kleine Stichprobe: Das zeigt keinen Verlust, aber keinen belegten Gewinn.