Wie man den Tokenverbrauch von Claude Code senkt
Claude Code gibt den Großteil seines Budgets aus, bevor überhaupt eine Antwort kommt. Hier steht, wohin die Tokens gehen und was die Zahl tatsächlich senkt.
Ein Coding-Agent sendet nicht Ihre Frage. Er sendet Ihre Frage plus alles, was er für gemeint hielt: die geöffneten Dateien, die durchlaufenen Verzeichnislisten, die Ausgabe jedes ausgeführten Befehls und das gesamte bisherige Gespräch, erneut, in jeder einzelnen Runde. Die Frage ist ein Rundungsfehler. Der Kontext darum ist die Rechnung.
Deshalb bringt der übliche Rat, kürzere Prompts zu schreiben, fast nichts. Sie können Ihren Prompt halbieren und die Summe um ein Prozent ändern. Die sieben Punkte unten sind nach ihrem tatsächlichen Wert sortiert.
1. Sagen Sie, welche Datei Sie meinen
Der größte vermeidbare Posten einer Agentensitzung ist die Erkundung: der Agent, der sich zu der Datei durchliest, die Sie längst offen hatten. Jedes Lesen, jede Suche, jede Verzeichnisliste landet im Kontext und bleibt dort für den Rest der Sitzung.
Die Datei zu benennen macht aus einer Suche einen direkten Zugriff. Das ist mehr wert als jede Option, jede Einstellung und jede Technik des Promptschreibens.
capsul ask 'warum bricht die Retry-Schleife zu früh ab' --open src/lib/retry.tsDie Datei geht vollständig mit. Es muss nichts erst gefunden werden.
2. Neue Sitzung, sobald das Thema wechselt
Der Gesprächsverlauf wird in jeder Runde vollständig erneut gesendet. Eine Sitzung mit vierzig Nachrichten bezahlt bei Nachricht einundvierzig alle vierzig, ob davon noch etwas relevant ist oder nicht.
Die teuerste Gewohnheit ist deshalb die natürlichste: eine lange Sitzung den ganzen Tag offen zu lassen. Zwei unabhängige Aufgaben in einem Strang heißt, die zweite bezahlt für die erste. Schließen und neu beginnen, wenn das Thema wechselt.
3. Setzen Sie eine Obergrenze für den Kontext
Ein Budget ist eine harte Obergrenze dafür, wie viel Kontext durchgelassen wird, ausgedrückt in Tokens. Es ist kein Vorschlag, den der Agent überschreiten darf, wenn er sich schlecht informiert fühlt.
capsul ask 'Rate Limit für die Login-Route ergänzen' --budget 3000Nichts läuft über die Grenze. Was weggelassen wurde, wird gemeldet.
Die Zahl zählt weniger als die Tatsache, dass es eine gibt. Ein Agent ohne Obergrenze füllt jedes Fenster, das man ihm gibt, weil es für ihn nie einen Grund gibt aufzuhören.
4. Modell zur Aufgabe passend wählen
Eine Variable umbenennen und eine Migration entwerfen sind nicht dieselbe Arbeit und sollten nicht auf demselben Modell laufen. Die meisten Sitzungen laufen komplett auf dem größten verfügbaren Modell, weil das die Voreinstellung ist, nicht weil jemand es entschieden hätte.
capsul ask 'userId im gesamten Auth-Modul in accountId umbenennen' --model haiku5. Werkzeugausgaben aus dem Verlauf halten
Ein Testlauf, der zweitausend Zeilen ausgibt, kostet zweitausend Zeilen Kontext und kostet sie in jeder weiteren Runde dieser Sitzung erneut. Dasselbe gilt für einen geschwätzigen Build, ein vollständiges git log und ein ungefiltertes find.
Leiten Sie das Laute durch etwas, das es kürzt, bevor der Agent es überhaupt sieht. head, grep, --quiet, --json mit einem Filter: alles billiger, als das Modell zu bitten, das Rauschen zu ignorieren.
6. Vorher und nachher messen, nicht nur nachher
Jede Aussage über Tokeneinsparung, die nicht an derselben Aufgabe auf demselben Modell gemessen wurde, ist geraten. Führen Sie das aus, was Sie wirklich tun, zweimal, und vergleichen Sie.
capsul context 'Ihre echte Aufgabe hier' --jsonBaut den Kontext und meldet, was er kostet, ohne eine Anfrage auszugeben.
7. Auf den Trend schauen, nicht auf die Runde
Eine einzelne Anfrage sagt nichts. Tokenverbrauch ist von Natur aus stoßweise: eine erkundungslastige Runde kann das Zehnfache einer bearbeitungslastigen kosten, und beides ist normal. Was zählt, ist die Wochenlinie.
capsul statsWas nicht funktioniert
- Das Modell um Kürze bitten. Ausgabetokens sind ein kleiner Teil der Rechnung; das Geld steckt in der Eingabe.
- Die Werkzeuge abschalten. Dann bittet der Agent Sie, die Datei einzufügen, und Sie fügen mehr davon ein, als nötig war.
- Auf ein größeres Kontextfenster wechseln. Ein doppelt so großes Fenster ist eine doppelt so große Rechnung für dieselbe Antwort, keine Ersparnis.
- Das Gespräch spät verdichten. Wenn die Verdichtung greift, haben Sie jede Runde davor bereits bezahlt.
Fragen
Wird es mit einem größeren Kontextfenster billiger?
Nein, teurer. Sie zahlen bei jeder Anfrage pro Eingabetoken, ein doppelt so großes Fenster ist also eine Einladung, doppelt so viel für dieselbe Antwort zu senden. Das Fenster ist eine Obergrenze, kein Guthaben.
Wie viele Tokens verbraucht eine Runde Claude Code?
Das hängt fast ausschließlich davon ab, wie viel der Agent erkundet hat, nicht von der Länge Ihrer Nachricht. Eine Runde, die vier Dateien liest und einen Test ausführt, kann Zehntausende Eingabetokens kosten; dieselbe Frage mit benannter Datei einen Bruchteil davon.
Zählen Ausgabetokens?
Weit weniger als Eingabetokens. Eine lange Antwort umfasst ein paar tausend Tokens. Der Kontext, der sie erzeugt hat, oft das Zehn- bis Hundertfache, und er wird in der nächsten Runde erneut gesendet, die Antwort nicht.
Verschlechtert weniger senden die Antwort?
Weniger senden ist nicht schlechter senden. Der Benchmark von capsul verfolgt Antwortprüfungen neben den Tokenzahlen, gerade damit eine mit einer falschen Antwort erkaufte Einsparung als solche sichtbar wird. Manche Zeilen gewinnen einen Ankerpunkt, manche verlieren einen, und beides wird veröffentlicht.
$ npm i -g @penra/capsul