Claude Code-Subagenten: Was sie sparen und was sie kosten

Was ein Subagent liest, bleibt aus Ihrem Hauptgespräch heraus, wird aber trotzdem abgerechnet. Ob er Tokens spart, hängt von der Menge des ausgelagerten Kontexts und den verbleibenden Runden ab.

Ein Subagent ist eine eigene Claude-Instanz, den Claude Code innerhalb Ihrer Sitzung startet. Er hat ein eigenes Kontextfenster, einen eigenen System-Prompt und eigene Tools. In diesem Fenster führt er seine Toolaufrufe durch, liest, sucht und führt Befehle aus und gibt dann nur sein Endergebnis zurück. Claude delegiert auch selbstständig, beispielsweise an den integrierten Explore-Subagenten, wenn er Code durchsuchen muss.

Subagenten sparen also Platz im Hauptkontext, nicht unbedingt Token. Ihr Hauptgespräch bleibt klein, weil ihre gelesenen Dateien dort nicht landen. Die über alle Agenten hinweg verarbeitete Gesamtsumme kann höher sein, da jeder Subagent für sein eigenes Setup und seine eigene Erkundung bezahlt und mehrere gleichzeitig beides multiplizieren.

Wofür ein Subagent Tokens verbraucht

Ein Subagent startet ohne Ihren Gesprächsverlauf, die bereits aufgerufenen Skills oder die Dateien, die Claude bereits gelesen hat, und arbeitet auf der Grundlage einer Nachricht, die Claude schreibt, um die Aufgabe zu übergeben. Jede Anfrage, die er stellt, beinhaltet:

  • Seinen eigenen System-Prompt, kürzer als die Ihrer Sitzung, und die Tools, die er verwenden darf, einschließlich MCP-Tools.
  • Ihre CLAUDE.md-Dateien und ein Git-Status-Snapshot. Die integrierten Subagenten „Explore“ und „Plan“ überspringen beide, um günstiger zu starten.
  • Die Aufgabennachricht sowie der vollständige Text aller Skills, die durch die Definition vorab geladen werden.

Dann durchläuft er seine eigene Agentenschleife. Das Ergebnis jedes Tool-Aufrufs, jeder gelesenen Datei und jeder Befehlsausgabe wird in seinen Kontext eingefügt, und jeder nächste Schritt sendet diesen wachsenden Kontext erneut. Je länger die Suche dauert, desto mehr überwiegt diese Schleife das Setup.

Caching hilft weniger als in Ihrem Hauptthread. Das Präfix eines Subagenten unterscheidet sich von dem Ihrer Konversation, sodass seine erste Anfrage Ihren Prompt-Cache nicht lesen kann und seine Einrichtung neu verarbeitet wird. Der neu aufgebaute Cache hält standardmäßig fünf Minuten, selbst bei einem Abonnement, bei dem Ihr Hauptgespräch eine Stunde dauert. Die Einstellung subagentPromptCacheTtl kann die Zeitspanne auf eine Stunde erhöhen, bei einem höheren Cache-Schreibpreis.

Schließlich kommt das Ergebnis zurück: die letzte Nachricht des Subagenten sowie ein kurzer Trailer mit Token-Anzahl und Dauer. Sie wird Teil Ihrer Konversation und wird bei jeder späteren Runde erneut gesendet, sodass ein Subagent, der um ein zweizeiliges Urteil gebeten wird, Ihren Hauptthread weniger kostet als einer, der um einen vollständigen Bericht gebeten wird.

Was er einspart

Eingespart wird im Hauptkontext alles, was der Subagent gelesen und ausgeführt hat und was nie zu Ihrer Konversation gelangt ist: die zahlreichen Dateien, die geöffnet wurden, um eine Funktion zu finden, die Tausende Zeilen Testausgabe hinter drei Fehlern. Wenn Sie dies in Ihrem Hauptthread erledigen, bleibt alles im Kontext und wird bei jeder Runde erneut gesendet, bis Sie es löschen oder komprimieren. Beim Prompt-Caching werden diese erneuten Lesevorgänge zu einem reduzierten Preis berechnet, aber sie werden trotzdem auf Ihre Limits angerechnet und belegen weiterhin Platz im Kontextfenster, über das das Modell verfügt.

Die Dokumentation von Claude Code zeigt ein Beispiel: Ein Recherche-Subagent liest etwa 6.100 Datei-Tokens, und die Hauptkonversation erhält ein Ergebnis mit 420 Tokens. Ihr Kontext ist durch das Ergebnis gewachsen. Die Lektüre wurde trotzdem im Kontext des Subagenten bezahlt.

Ein Subagent gewinnt also, wenn das, was er fernhält, groß ist und Ihre Sitzung noch viele Runden hat, und verliert, wenn die Aufgabe klein ist oder er erneut lesen muss, was Ihre Konversation bereits enthält.

Wenn sich Subagenten lohnen

  • Beim Erkunden von Code, den Sie noch nicht kennen, stellt sich heraus, dass das meiste, was gelesen wird, irrelevant ist.
  • Ausführliche Operationen, von denen Sie nur ein Urteil benötigen: ein auf seine Fehler reduzierter Testlauf, ein Protokoll auf seine Fehler, eine Seite Dokumentation auf eine Antwort.
  • Lange Aufgaben. Je mehr Runden Ihre Hauptsitzung vor sich hat, desto mehr ist jeder von ihr ferngehaltene Token wert.
  • Unabhängige Untersuchungen parallel. Sie dauern so lang wie die langsamste Untersuchung und nicht in der Summe aller, was Zeit und keine Token spart: Jeder benötigt seine eigene Einrichtung.
  • Arbeiten, die ein kleineres Modell gut erledigt, wie z. B. Suchen, Zusammenfassen und Ausführen von Prüfungen.

Wenn sie Token verschwenden

  • Kleine, gezielte Veränderungen. Wenn Sie die Datei bereits kennen, überwiegt die Einrichtung die Erkundung, die sie ersetzt, und ein neuer Subagent benötigt Zeit, um den Kontext zu erfassen, bevor er handeln kann.
  • Arbeit, die davon abhängt, was Ihr Gespräch bereits weiß. Ein neuer Subagent liest Dateien erneut, die Claude bereits gelesen hat. Häufiges Hin und Her oder Phasen mit gemeinsamem Kontext wie Planung, Implementierung und Test gehören zum Hauptgespräch.
  • Überlappende Parallelagenten. Drei Subagenten, die jeweils dasselbe Kernmodul benötigen, lesen es, und jedes Ergebnis landet in Ihrem Kontext.
  • Viele Agenten gleichzeitig im Abonnement. Jeder Subagent nutzt die gleichen Planlimits wie Ihr Hauptgespräch, und in der Dokumentation von Claude Code heißt es eindeutig, dass die gleichzeitige Ausführung mehrerer Subagenten die Token-Nutzung vervielfacht.

Die Delegation kann auch verschachtelt werden. Ab September 2026 kann ein Subagent standardmäßig bis zu drei Ebenen unter Ihrer Konversation einen eigenen Subagenten starten und bis zu 20 können gleichzeitig ausgeführt werden. Wenn Sie CLAUDE_CODE_MAX_SUBAGENT_SPAWN_DEPTH auf 1 setzen, wird die Verschachtelung deaktiviert, und CLAUDE_CODE_MAX_CONCURRENT_SUBAGENTS ändert die Obergrenze.

Zwei weitere Befehle helfen in ähnlichen Fällen. /btw beantwortet eine Nebenfrage aus dem, was Ihre Konversation bereits enthält, ohne Tools und hält die Antwort aus dem Verlauf heraus. /subtask startet einen Fork, einen Subagenten, der Ihre Konversation erbt und seinen Cache liest. Die Dokumentation nennt dies günstiger als einen neuen Subagenten für Aufgaben, die denselben Kontext benötigen, obwohl ein Fork so groß beginnt wie Ihre Konversation.

Setzen Sie einen Subagenten auf ein günstigeres Modell

Ein benutzerdefinierter Subagent ist eine Markdown-Datei in .claude/agents/ für ein Projekt oder ~/.claude/agents/ für alle Ihre Projekte, mit YAML-Frontmatter über der System-Prompt. Das Feld model nimmt haiku, sonnet, opus, fable, eine vollständige Modell-ID wie claude-opus-5-5 oder inherit auf. Für einen Subagenten, der sucht, zusammenfasst oder Prüfungen durchführt, fügen Sie model: haiku hinzu.

Claude Code wählt das Modell eines Subagenten in dieser Reihenfolge aus: ein Modell, das Claude für diesen einen Aufruf übergibt, das Feld model der Definition, die Umgebungsvariable CLAUDE_CODE_SUBAGENT_MODEL und dann das Modell Ihrer Hauptkonversation. Dieser letzte Schritt ist mit Kosten verbunden: Wechseln Sie mit /model zu Opus, und jeder Subagent, der Ihr Modell erbt, wechselt mit Ihnen.

Der integrierte Explore-Subagent verwendet nicht mehr standardmäßig Haiku. Seit Claude Code v2.1.198 erbt es das Modell Ihrer Sitzung, begrenzt auf Opus auf der Claude-API. Um die Erkundung kostengünstig zu gestalten, erstellen Sie Ihren eigenen Subagenten namens Explore mit model: haiku, der den integrierten Subagenten überschreibt. Im Gegensatz zur integrierten Version lädt es Ihre CLAUDE.md-Dateien, es sei denn, Sie fügen omitClaudeMd: true hinzu. CLAUDE_CODE_SUBAGENT_MODEL allein bewegt Explore oder Plan nicht; Durch das Hinzufügen von CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 (v2.1.257 oder höher) wird es auch auf sie angewendet.

Mit Stand September 2026 liegen die API-Listenpreise von Anthropic für Claude Haiku 4.5 bei 1 US-Dollar pro Million Input-Tokens und 5 US-Dollar pro Million Output, gegenüber 2 US-Dollar und 10 US-Dollar für Sonnet 5 und 4 US-Dollar und 20 US-Dollar für Opus 5.5. Für Abonnenten gibt das Hilfecenter von Anthropic an, dass Opus ein Vielfaches mehr pro Runde kostet als Sonnet und Sonnet mehr als Haiku.

Es gilt eine Einschränkung: Die Größe des Kontextfensters eines Subagenten richtet sich nach seinem eigenen Modell, und Haiku 4.5 verfügt über ein Kontextfenster mit 200.000 Tokens, während Sonnet 5 und Opus 5.5 eine Million Tokens haben. Zwei weitere Felder begrenzen die Ausgaben: maxTurns begrenzt die Anzahl der Agentenrunden, die ein Subagent ausführen darf, und bei Sonnet oder Opus verringert effort: low seinen Denkaufwand, ohne den Denkaufwand Ihrer Sitzung zu ändern.

/tasks

Listet laufende und gerade abgeschlossene Subagenten mit dem Modell auf, auf dem jeder einzelne tatsächlich läuft.

Den Verbrauch von Subagenten prüfen

Für Gesamtsummen verwenden Sie die Tools, die alles addieren:

  • /usage in einem Pro-, Max-, Team- oder Enterprise-Plan ordnet die aktuelle Nutzung Subagenten, Skills, Plugins und MCP-Servern zu, jeweils als Anteil an der Gesamtsumme. d und w wechseln zwischen den letzten 24 Stunden und sieben Tagen. Es liest den lokalen Sitzungsverlauf, sodass andere Maschinen und claude.ai nicht einbezogen werden, und die Zeile Prompt cache (main) deckt nur Ihre Hauptkonversation ab.
  • In Skripten gibt claude -p --output-format json total_cost_usd und eine Aufschlüsselung pro Modell zurück. In der Agent SDK-Dokumentation wird ausdrücklich darauf hingewiesen, dass das Feld usage nur die Schleife der obersten Ebene zählt, während total_cost_usd und modelUsage Subagentenanforderungen umfassen.
  • Für ein Team kennzeichnen das OpenTelemetry-Token und die Kostenzähler jede Anfrage mit query_source, setzen es auf subagent für Subagentenanfragen und mit agent.name.
  • Das Transkript jedes Subagenten, das zeigt, was er gelesen und ausgeführt hat, wird standardmäßig 30 Tage lang unter ~/.claude/projects/{project}/{sessionId}/subagents/ gespeichert.
/usage

Bei Abonnementplänen zeigt die Aufschlüsselung, welcher Anteil der letzten Nutzung an Subagenten ging.

Bevor Sie delegieren

Die billigste Erkundung, ob delegiert oder nicht, ist die, die nicht stattfindet. Benennen Sie die Datei, wenn Sie sie kennen, und stellen Sie eher eine eng gefasste als eine allgemeine Frage. Halten Sie den description jedes benutzerdefinierten Subagenten kurz: Beschreibungen nehmen den Kontext Ihrer Hauptkonversation auf, während den System-Prompt eines Subagenten nur geladen wird, wenn er ausgeführt wird.

Wenn Sie den Kontext für die Erkundung begrenzen möchten, steuert capsul die Claude-Code-CLI, bei der Sie bereits angemeldet sind. Es sendet, was die Aufgabe verlangt, hält das von Ihnen gesetzte Tokenbudget ein und meldet, was weggelassen wurde.

capsul ask 'why does the session expire early' --budget 3000

Nichts überschreitet das Budget, und was weggelassen wurde, wird gemeldet.

Fragen

Sparen Subagenten in Claude Code Tokens?

Sie sparen Platz in Ihrem Hauptgespräch, nicht unbedingt Token insgesamt. Jeder Subagent zahlt für seine eigene Einrichtung und seine eigenen Lesevorgänge, und seine erste Anfrage kann den Prompt-Cache Ihrer Konversation nicht verwenden. Es hat die Nase vorn, wenn umfangreiche Ausgaben wie eine umfassende Suche oder ein langes Testprotokoll aus einer Sitzung mit vielen verbleibenden Runden herausgehalten werden.

Welches Modell verwendet ein Claude Code-Subagent?

Ein benutzerdefinierter Subagent wird auf dem Modell in seinem model-Feld ausgeführt (haiku, sonnet, opus, fable, eine vollständige Modell-ID oder inherit); ohne eine, auf der CLAUDE_CODE_SUBAGENT_MODEL-Standardeinstellung, wenn Sie sie festlegen, andernfalls auf dem Modell Ihrer Hauptkonversation. Ein Modell, das Claude für einen einzigen Anruf akzeptiert, setzt all dies außer Kraft. Ab September 2026 erbt der integrierte Explore-Subagent das Modell Ihrer Sitzung, begrenzt auf Opus auf der Claude-API, sodass Sie mit einem benutzerdefinierten Subagenten namens Explore mit model: haiku weiterhin kostengünstig suchen können.

Wie sehe ich, wie viele Token meine Subagenten verwendet haben?

Bei einem Pro-, Max-, Team- oder Enterprise-Plan zeigt /usage den Anteil der aktuellen Nutzung an, der in den letzten 24 Stunden oder sieben Tagen an Subagenten ging. Lesen Sie in Skripten total_cost_usd oder die Aufschlüsselung pro Modell anstelle von usage, das laut Agent SDK-Dokumentation Subagentenanfragen auslässt. Die neben einem Subagenten angezeigte Token-Anzahl spiegelt seine Kontextgröße wider, nicht die Gesamtzahl der verarbeiteten Token.

Verbrauchen parallele Subagenten meinen Claude-Plan schneller?

Ja. Jeder Subagent stellt seine eigenen Anfragen gegen die gleichen Plangrenzen wie Ihr Hauptgespräch, und in der Dokumentation von Claude Code heißt es, dass die gleichzeitige Ausführung mehrerer Subagenten die Token-Nutzung vervielfacht. Durch die parallele Ausführung wird Arbeitszeit gespart, da unabhängige Aufgaben in der Zeit der langsamsten abgeschlossen werden, es werden jedoch keine Token eingespart.

Sind Subagenten dasselbe wie Agententeams?

Nein. Subagenten werden innerhalb einer Sitzung ausgeführt und berichten an diese. Agententeams, experimentell und standardmäßig deaktiviert, führen separate Claude-Code-Instanzen aus, die sich gegenseitig Nachrichten senden, und auf der Kostenseite von Anthropic wird geschätzt, dass sie etwa das Siebenfache der Token einer Standardsitzung verbrauchen, wenn Teamkollegen im Planmodus ausgeführt werden.

$ npm i -g @penra/capsul

← Alle Ratgeber