Claude Code vs. Codex CLI: Wohin die Tokens gehen

Welcher Agent weniger Tokens verbraucht, hängt vor allem vom Modell, der Einrichtung und der Aufgabe ab. Hier erfahren Sie, wo die Eingabetokens anfallen, was die Tools anzeigen und wie Sie Messwerte vergleichen.

Claude Code und Codex CLI sind CLI-Coding-Agenten, die auf die gleiche Weise aufgebaut sind: ein Modell in einer Schleife, das Dateien liest, Befehle ausführt und Code in dem Verzeichnis bearbeitet, in dem Sie es gestartet haben. Sie geben Token also auf die gleiche Weise aus. Jede Anfrage beinhaltet weit mehr als Ihre Frage, und die Frage ist der kleinste Teil davon.

Die kurze Antwort auf die Frage, warum man weniger Token verwendet, lautet: Keiner von beiden funktioniert zuverlässig. Das Modell, das Sie auswählen, die Anweisungen und Tools, die Sie aktiviert haben, und wie viel der Agent erkundet, beeinflussen die Gesamtheit mehr als die Wahl des Agenten.

Wohin die Tokens bei beiden Agenten gehen

Jede Anfrage umfasst in beiden Tools drei Eingabeebenen:

  • Umgebungseingabe: die eigenen Anweisungen des Agenten, die Definition jedes Tools, das das Modell aufrufen kann, Ihre Projektanweisungen (CLAUDE.md für Claude Code, AGENTS.md für Codex) und alle aktivierten Skills, Plugins oder MCP-Server. Es ist da, bevor Sie etwas eingeben.
  • Erkundung: Jede gelesene Datei, Suche und Befehlsausgabe nimmt an der Konversation teil und bleibt dort für den Rest der Sitzung.
  • Mitschrift: Bei jeder Anfrage wird das gesamte Gespräch noch einmal gesendet, inklusive jedes bisherigen Tool-Ergebnisses. Für eine Frage sind in der Regel mehrere Anfragen erforderlich, eine pro Schritt, den der Agent ausführt.

Schnelles Caching mildert das Transkript auf beiden Seiten: Ein Präfix, das der Anbieter bereits verarbeitet hat, wird als Cache-Lesevorgang abgerechnet, und zwar zu einem Zehntel der Frischrate für die meisten Modelle ab September 2026, sowohl auf der Preisliste von Anthropic als auch auf OpenAI. Beide Agenten komprimieren außerdem den Verlauf in einer Zusammenfassung, wenn das Fenster gefüllt ist, und /compact führt dies bei Bedarf durch.

Was jeder lädt, bevor Sie tippen

Claude Code ordnet jede Anfrage auf die gleiche Weise: zuerst die Kernanweisungen und Tooldefinitionen, dann Ihren Projektkontext (CLAUDE.md, automatischen Speicher, Regeln) und dann die Konversation. MCP-Tools werden bei unterstützten Modellen standardmäßig zurückgestellt, sodass ein inaktiver Server seine Toolnamen und Anweisungen und nicht seine vollständigen Schemata verbraucht, bis Claude eines benötigt. Skills kosten jeweils eine einzeilige Beschreibung, bis sie aufgerufen werden.

Codex CLI erstellt beim Start eine Anweisungskette aus AGENTS.md-Dateien, eine von Ihrem Codex-Home und dann eine pro Verzeichnis vom Projektstamm bis zu Ihrem Standort und stoppt standardmäßig das Hinzufügen von Dateien bei 32 KiB. Es fügt einen Katalog verfügbarer Skills hinzu, dessen Token-Budget standardmäßig zwei Prozent des Kontextfensters des Modells beträgt. MCP-Server in config.toml steuern ihre Tools bei, werden hinter einem Suchschritt zurückgestellt, wenn das Modell dies unterstützt, und andernfalls vollständig gesendet; enabled_tools und disabled_tools kürzen, was jeder Server verfügbar macht.

Keine der Listen ist festgelegt: Es hängt davon ab, was Sie installiert haben. Das ist der erste Grund, warum ein Vergleichslauf auf dem Computer einer anderen Person nicht auf Ihren übertragen wird.

Welche Verbrauchsdaten die Agenten anzeigen

Claude Code meldet die Nutzung in Token und in geschätzten Dollar:

/usage

Claude Code zeigt Tokens nach Modell, Cache-Lese- und Schreibvorgänge, eine Listenpreisschätzung und bei einem Abonnement Ihre Plannutzung.

/context

Claude Code: Was füllt gerade das Kontextfenster, nach Kategorie sortiert.

Codex CLI meldet Token und, wenn Sie bei ChatGPT angemeldet sind, den Anteil Ihrer Limits, den Sie verwendet haben:

/status

Codex: das Modell, das verwendete und verbleibende Kontextfenster und wie viel von den Fünf-Stunden- und Wochenlimits übrig bleibt.

codex debug prompt-input 'where is the retry limit set'

Gibt die Eingabeliste, die Codex für diese Eingabeaufforderung senden würde, als JSON aus, ohne das Modell aufzurufen.

/usage in Codex zeigt die Token-Aktivität Ihres Kontos nach Tag, nach Woche oder insgesamt an, und beim Beenden wird eine Token-Zeile für die Sitzung gedruckt. In der debug prompt-input-Ausgabe werden die Basisanweisungen und die Toolschemata weggelassen, die neben dieser Liste angezeigt werden. Lesen Sie sie also als eine Untergrenze und nicht als die gesamte Anforderung.

Wie jeder abrechnet

Beide Agenten laufen entweder mit einem Abonnement oder mit Pay-per-Token-Abrechnung, und die beiden Zähler unterscheiden sich:

  • Claude Code auf Claude Pro oder Max: Die Nutzung wird auf ein Sitzungslimit angerechnet, das alle fünf Stunden zurückgesetzt wird, und auf ein wöchentliches Limit, das mit Ihrer Nutzung von Claude selbst geteilt wird. Team- und Enterprise-Sitze funktionieren auf die gleiche Weise. Bei der Dollarzahl /usage handelt es sich um eine Listenpreisschätzung, die laut Anthropic für die Abrechnung von Pro und Max nicht relevant ist.
  • Claude-Code auf einem API-Schlüssel oder der Claude-Konsole: Abrechnung pro Token zu API-Tarifen, Cache-Lese- und Schreibvorgänge inbegriffen. Ein in Ihrer Umgebung verbleibender ANTHROPIC_API_KEY übernimmt Ihr Abonnement, sobald Sie ihn genehmigen, und claude -p verwendet ihn ohne Aufforderung.
  • Mit ChatGPT angemeldete Codex-CLI: Die Nutzung wird auf das Kontingent Ihres Plans angerechnet, das auf der Preisseite von OpenAI in lokalen Nachrichten pro Fünf-Stunden-Fenster geschätzt wird, wobei möglicherweise auch wöchentliche Limits gelten. Über die enthaltene Nutzung hinaus können Sie mit Credits fortfahren. Bei Plus und Pro zeigt Ihnen Codex Token und Prozentsätze Ihrer Limits an, keine Dollars.
  • Codex CLI mit einem API-Schlüssel: Abrechnung über Ihr OpenAI Platform-Konto zu Standard-API-Tarifen.

Was unser Benchmark gemessen hat

Wir haben beide Agenten einzeln ausgeführt, so wie jeder sie ausführt (claude -p und codex exec mit ihrer üblichen Konfiguration, nicht im --bare-Modus von Claude Code), und zwar mit denselben fünf einzeiligen Fragen zu einem Repository. Die Einheit ist eine Cache-gewichtete Eingabe pro Frage: alles, was der Agent zur Beantwortung gesendet hat, über alle seine Anfragen hinweg, mit frischen Token mit voller Gewichtung und Cache-Lesevorgängen mit einem Zehntel. Jede Zeile ist ein Modell.

Die Tabellen zeigen für jedes Modell einen Lauf des Agenten allein und dieselbe Frage über capsul auf demselben Modell. Für den Vergleich der Agenten sind die Läufe ohne capsul maßgeblich. Die Antwortprüfungen zählen, bei wie vielen der fünf automatisch geprüften Fragen die erwarteten Details in der Antwort standen.

ModellEingabe, purEingabe, capsulKosten, purKosten, capsulWeniger Eingabe
Claude Haiku 4.555.50019.3000,0812 $0,0265 $x2.88
Claude Sonnet 554.20018.9000,153 $0,0487 $x2.86
Claude Sonnet 4.631.40016.6000,139 $0,0613 $x1.89
Claude Opus 4.645.70016.4000,332 $0,101 $x2.78
Claude Opus 4.738.70020.1000,28 $0,126 $x1.92
Claude Opus 4.865.80013.8000,498 $0,0825 $x4.75
Claude Opus 545.30016.2000,343 $0,101 $x2.80
Claude Opus 5.542.30015.9000,222 $0,0696 $x2.66
Claude Fable 541.40017.6000,633 $0,219 $x2.35
Claude Fable 5.149.70023.4000,636 $0,279 $x2.12
Claude-Modelle in Claude Code: cachegewichtete Eingabe und API-Äquivalentkosten pro einzeiliger Programmierfrage, purer Agent oder mit capsul. Aus den veröffentlichten Datensätzen berechnet: Claude-Kampagne vom 22. September 2026, Codex-Kampagne vom 4. September 2026.

Die Claude-Tabelle fügt eine Kostenspalte hinzu: Was Claude Code selbst angibt, würden diese Token pro Frage zu API-Listenpreisen kosten. Bei einem Abonnement zahlen Sie diesen Betrag nicht.

ModellEingabe, purEingabe, capsulWeniger Eingabe
gpt-5.6-sol33.10014.700x2.26
gpt-5.6-terra24.00011.100x2.16
gpt-5.6-luna32.10013.600x2.36
gpt-5.547.2008.130x5.81
gpt-5.431.8008.220x3.86
gpt-5.4-mini42.30012.100x3.49
GPT-Modelle in Codex CLI: cachegewichtete Eingabe pro einzeiliger Programmierfrage, purer Agent oder mit capsul. Codex meldet Tokens, keine Dollarbeträge. Aus den veröffentlichten Datensätzen berechnet: Claude-Kampagne vom 22. September 2026, Codex-Kampagne vom 4. September 2026.

Die Codex-Tabelle enthält keine Kostenspalte, da Codex bei einem ChatGPT-Plan Token und keine Dollars meldet, und das ist der Plan, den diese Läufe verwendeten.

Warum die beiden Tabellen kein Ranking sind

Wenn man sie nebeneinander liest, sind die beiden Tabellen aus fünf Gründen bestenfalls indikativ:

  • Unterschiedliche Daten und Codeversionen. Die Claude-Reihen wurden am 22. September 2026 und die Hauptkampagne für Codex am 4. September 2026 gemessen, jeweils mit den damaligen Versionen der Agenten und von capsul.
  • Verschiedene Modelle. In beiden Tabellen erscheint kein Modell, daher ist jeder agentenübergreifende Vergleich auch ein Vergleich von Modellen.
  • Verschiedene Token. Jeder Anbieter schneidet Text auf seine eigene Weise in Tokens, und Anthropic stellt fest, dass seine neueren Modelle den gleichen Text als etwa 30 Prozent mehr Tokens zählen als seine älteren. Ein Token ist keine feste Textmenge.
  • Verschiedene Hauptbücher. Claude meldet Cache-Schreibvorgänge, die der Benchmark über neuem Input gewichtet, da Anthropic sie in Rechnung stellt. Bei den Codex-Ausführungen wurden keine gemeldet, und für die Gutschriftsabrechnung von Codex bei ChatGPT-Plänen fallen keine separaten Cache-Schreibgebühren an.
  • Verschiedene Wiederholungen. Jede Claude-Frage wurde dreimal pro Arm und jede Codex-Frage zweimal ausgeführt, und beim ersten Durchlauf wird der Cache geschrieben, den die späteren gelesen haben.

Was diese Vorbehalte übersteht, ist immer noch nützlich. Bei einer einzeiligen Frage senden beide Agenten allein Zehntausende von Cache-gewichteten Tokens, die fast ausschließlich aus dem Kontext und nicht aus der Frage bestehen. Und innerhalb jeder Tabelle ist die Spanne zwischen den Modellen groß: Das von Ihnen ausgewählte Modell verschiebt die Zahl mindestens so stark wie der von Ihnen ausgewählte Agent.

Was Sie daraus ableiten können

Wenn Sie bereits für einen der beiden Pläne bezahlen, ist der Wechsel des Agenten zum Sparen von Token selten der entscheidende Hebel. Diejenigen, die dies tun, sind in beiden Tools gleich:

  • Beginnen Sie jede Aufgabe in einer neuen Sitzung. /clear führt dies in beiden Fällen aus und das alte Transkript wird nicht mehr erneut gesendet.
  • Benennen Sie die Datei, die Sie meinen. Die Erkundung ist die Ebene, die von Lauf zu Lauf am stärksten variiert.
  • Halten Sie die Umgebungsschicht klein: ein kurzes CLAUDE.md oder AGENTS.md und keine MCP-Server oder Plugins, die Sie nicht verwenden.
  • Passen Sie das Modell und den Argumentationsaufwand an die Aufgabe an: /model und /effort in Claude Code, /model in Codex, wodurch beide dort festgelegt werden, wo das Modell dies zulässt.

Um die beiden in Ihrem eigenen Code zu vergleichen, messen Sie eine echte Aufgabe, nicht die Tabelle von irgendjemandem, auch unsere. Führen Sie es dreimal pro Agent aus, jeweils in einer neuen Sitzung im selben Repository: Beim ersten Durchlauf wird der Cache geschrieben und beim nächsten wird er gelesen. Addieren Sie mit claude -p und --output-format json die Eingabe-, Cache-Lese- und Cache-Schreibzahlen pro Modell, einschließlich Subagenten (das einfache usage-Feld nicht). Lesen Sie mit codex exec --json die Nutzung beim letzten turn.completed-Ereignis und subtrahieren Sie den zwischengespeicherten Teil von der Eingabe. Gewichten Sie neue Eingaben vollständig, Cache-Lesevorgänge mit einem Zehntel und alle gemeldeten Cache-Schreibvorgänge mit der in Rechnung gestellten Prämie, und Sie haben Kosten pro Aufgabe in Token für jeden Agenten bei Ihrer eigenen Arbeit.

Wenn Sie beide Agenten verwenden, steuert capsul einen von beiden mit demselben Befehl und einem von Ihnen festgelegten Token-Budget und zeichnet lokal auf, was jeder einzelne ausgibt.

capsul burn

Lokale Ausgaben, aufgeschlüsselt nach Agent, Modell und Projekt.

Fragen

Verwendet Claude Code oder Codex CLI weniger Token?

Funktioniert auch nicht zuverlässig. Das Modell, die Anweisungen und Tools, die Sie aktiviert haben, und wie viel der Agent erforscht, beeinflussen die Gesamtsumme mehr als die Wahl des Agenten, und jeder Anbieter schneidet Text anders in Tokens. In unserem Benchmark, bei dem beide Agenten einzeln ausgeführt wurden, war die Spanne zwischen den Modellen auf einem Agenten mindestens so groß wie die Lücke zwischen den beiden Agenten.

Ist Codex CLI günstiger als Claude Code?

Bei einem Abonnement bestimmt der Preis den Plan, und der Unterschied besteht darin, wie lange es dauert, bis das Fünf-Stunden- oder Wochenlimit erreicht ist. Bei einem API-Schlüssel rechnen beide pro Token zu den Listenpreisen ihres Anbieters ab, wobei die zwischengespeicherten Eingaben bei den meisten Modellen etwa ein Zehntel des Neutarifs betragen. In jedem Fall ist der für Sie günstigere Agent derjenige, der Ihre Aufgaben mit einem kleineren Modell und weniger Kontext beantwortet, was nur eine Messung an Ihrem eigenen Code zeigen kann.

Warum zeigt Claude Code einen Dollarpreis an, wenn ich für Pro oder Max bezahle?

/usage berechnet die Sitzungskosten anhand der Token-Anzahl zu API-Listenpreisen, also dem, was die gleiche Arbeit an einem API-Schlüssel kosten würde. In der Dokumentation von Anthropic heißt es, dass diese Zahl für Pro- und Max-Abonnenten nicht für die Abrechnung relevant ist. Was auf Ihren Plan angerechnet wird, wird auf demselben Bildschirm wie die Nutzungsbalken angezeigt.

Wie kann ich die Codex-CLI-Token-Nutzung in einem ChatGPT-Plan sehen?

Geben Sie /status für das verwendete und verbleibende Kontextfenster und den Anteil Ihrer verbleibenden Fünf-Stunden- und Wochenlimits ein, oder /usage für die Token-Aktivität Ihres Kontos pro Tag, pro Woche oder insgesamt. Wenn Sie beenden, druckt Codex die Token-Zählungen der Sitzung aus: Die Gesamtzahl addiert neue Eingaben und Ausgaben, und zwischengespeicherte Eingaben werden separat aufgelistet.

Kann ich die Token-Anzahl vergleichen, die die beiden Agenten melden?

Nicht wie gedruckt. Claude meldet Eingaben, Cache-Lesevorgänge und Cache-Schreibvorgänge als separate Zählungen, während input_tokens in der JSON-Ausgabe von Codex bereits zwischengespeicherte Eingaben enthält. Konvertieren Sie beide in Cache-gewichtete Eingaben, neue Token mit voller Gewichtung und Cache-Lesevorgänge mit einem Zehntel und vergleichen Sie die gleiche Aufgabenausführung mehrmals.

$ npm i -g @penra/capsul

← Alle Ratgeber