Was MCP-Server an Tokens kosten und wie Sie das senken

Ein MCP-Server verbraucht Tokens in der Toolliste, in geladenen Tool-Definitionen und in gespeicherten Ergebnissen. Hier erfahren Sie, wie Sie diese Kosten sichtbar machen und begrenzen.

Ein Modell kann nur ein Tool aufrufen, das ihm beschrieben wurde, und die Beschreibung wandert innerhalb der Anfrage: ein Name, ein paar Textsätze und ein JSON-Schema für die Eingaben. Die Preisgestaltung für die Toolnutzung von Anthropic zählt alles als Eingabetoken, wie jeden anderen Teil der Eingabeaufforderung. MCP-Server verwenden also Token, und in einem Coding-Agenten verwenden sie diese bei jeder Runde, da bei jeder Runde der gesamte Kontext erneut gesendet wird.

Wie hoch die Kosten sind, hängt davon ab, ob der Agent Tool-Definitionen erst bei Bedarf lädt. Im September 2026 tun das Claude Code und aktuelle Codex-CLI-Versionen bei unterstützten Modellen für die meisten MCP-Tools. Ein ungenutzter Server kostet damit weniger, aber nicht nichts. Manche Konfigurationen laden weiterhin alle Definitionen vorab.

Was ein MCP-Server einer Anfrage hinzufügt

  • Werkzeugdefinitionen: Name, Beschreibung und JSON-Eingabeschema jedes Werkzeugs. In der Tool-Suchdokumentation von Anthropic wird das Beispiel von fünf gängigen Servern (GitHub, Slack, Sentry, Grafana und Splunk) aufgeführt, die etwa 55.000 Definitionstoken vor dem Modell ablegen können, bevor es irgendwelche Arbeiten ausführt.
  • Serveranweisungen: Ein kurzer Text, den der Server zurückgibt, wenn er eine Verbindung herstellt, und der dem Modell mitteilt, wozu er dient. Claude Code lädt es beim Sitzungsstart und schneidet es standardmäßig auf 2.048 Zeichen.
  • Aufrufe und Ergebnisse: Jeder Aufruf des Modells und jedes Ergebnis, das der Server zurückgibt, werden Teil des Transkripts. Ein Ergebnis, das eine Problemliste oder ein Datenbankschema enthält, kann Tausende von Token umfassen und wird bei jeder späteren Runde mit der zwischengespeicherten Rate erneut gesendet, solange der Cache gespeichert ist, bis es durch Komprimierung oder Löschen entfernt wird.
  • Die Tool-Use-System-Prompt: Immer wenn eine Anfrage ein Tool enthält, fügt die Claude-API ihre eigenen Anweisungen hinzu, 286 Token auf Opus 5.5, 354 auf Sonnet 5 und 496 auf Haiku 4.5 in der veröffentlichten Tabelle von Anthropic (Stand September 2026). Ein Coding-Agent zahlt dies trotzdem, da seine integrierten Tools auch Tools sind; MCP-Server vervielfachen es nicht.

Tool-Definitionen: vorab geladen oder bei Bedarf

Claude Code aktiviert die Werkzeugsuche standardmäßig. Beim Sitzungsstart gelangen nur Werkzeugnamen und Serveranweisungen in den Kontext, und das vollständige Schema eines Werkzeugs wird geladen, wenn Claude danach sucht. Anthropic sagt, dass die Tool-Suche den Definitionsaufwand in der Regel um mehr als 85 Prozent senkt und die drei bis fünf Tools lädt, die eine Anfrage benötigt. Eine geladene Definition bleibt dann in der Konversation und wird mit dem Rest des Verlaufs erneut gesendet.

MCP-Definitionen gehen in den folgenden Fällen vollständig in jede Anfrage zurück:

  • ANTHROPIC_BASE_URL verweist auf einen Proxy oder Gateway, der nicht von Anthropic stammt. Legen Sie ENABLE_TOOL_SEARCH=true fest, wenn Ihr Gateway die Block-Tool-Suche weiterleitet.
  • ENABLE_TOOL_SEARCH=false ist festgelegt, oder CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS, wodurch die Werkzeugsuche auch dann ausgeschaltet bleibt, wenn auch ENABLE_TOOL_SEARCH festgelegt ist.
  • ENABLE_TOOL_SEARCH=auto ist festgelegt: Definitionen werden dann im Voraus geladen, solange sie weniger als 10 Prozent des Kontextfensters ausmachen.
  • Ein Server ist für die Tools dieses Servers mit alwaysLoad: true gekennzeichnet.
  • Die Bereitstellung lehnt die Toolsuche ab: Claude-Modelle älter als die 4.5-Generation auf der Agent-Plattform von Google Cloud und auf Azure gehostete Microsoft Foundry-Bereitstellungen.

Den Overhead in Claude Code sehen

/context all

Unterteilt das Kontextfenster nach Kategorien und listet die Token auf, die jedes geladene MCP-Tool verwendet.

/context zeigt alles im Fenster nach Kategorie an: System-Prompt, Systemtools, MCP-Tools, Speicherdateien, Skills und Meldungen, und all erweitert die Aufschlüsselung nach Elementen. Führen Sie es zu Beginn einer Sitzung aus, um zu sehen, was Ihr Setup kostet, bevor Sie etwas eingeben, und nach ein paar Tool-Aufrufen noch einmal, um zu sehen, was die Ergebnisse gebracht haben.

/mcp

Listet jeden konfigurierten Server mit seinem Status und der Anzahl der Tools auf und schaltet Server für das aktuelle Projekt ein oder aus.

Bei einem Pro-, Max-, Team- oder Enterprise-Plan ordnet /usage die aktuelle Nutzung auch einzelnen MCP-Servern zu und zählt nur die Anfragen, die eines der Ergebnisse dieses Servers enthielten. Es zeigt Ihnen, welcher Server in der Nutzung teuer ist, und nicht, welcher Server teuer in der Wartung ist, was normalerweise die nützlichere Antwort ist.

Claude Code warnt außerdem, wenn ein einzelnes MCP-Ergebnis 10.000 Token überschreitet, und begrenzt die Ergebnisse standardmäßig über MAX_MCP_OUTPUT_TOKENS auf 25.000 Token. Ein größeres Ergebnis wird in einer Datei gespeichert und die Konversation erhält den Pfad anstelle des Inhalts.

Den Overhead in Claude Code senken

  • Deaktivieren Sie, was das Projekt nicht verwendet. Schalten Sie einen Server in /mcp aus oder geben Sie /mcp disable <server> ein. Claude Code zeichnet die Auswahl pro Projekt auf und behält die Konfiguration bei.
  • Ordnen Sie Server den Projekten zu, die sie benötigen. claude mcp add ist standardmäßig auf den lokalen Bereich eingestellt, nur dieses Projekt. --scope user lädt einen Server in jedem Projekt auf dem Computer, und ein eingecheckter .mcp.json lädt ihn für jeden, der ihn in diesem Repository genehmigt.
  • Überprüfen Sie Ihre Claude.ai-Anschlüsse. Wenn Sie mit einem claude.ai-Abonnement angemeldet sind, lädt Claude Code automatisch die Connectors, die Sie auf claude.ai hinzugefügt haben. Legen Sie "disableClaudeAiConnectors": true im .claude/settings.json eines Projekts fest oder starten Sie Claude Code mit ENABLE_CLAUDEAI_MCP_SERVERS=false, um sie wegzulassen.
  • Verwenden Sie die CLI, sofern vorhanden. In den Kostenrichtlinien von Anthropic heißt es, dass gh, aws, gcloud und sentry-cli überhaupt keine Auflistung pro Tool hinzufügen und Claude sie direkt ausführen kann.
  • Halten Sie den Aufschub aufrecht. Reservieren Sie alwaysLoad für die wenigen Werkzeuge, die bei jedem Schritt benötigt werden.
  • Entfernen Sie einzelne Werkzeuge, die Sie nie benötigen. Eine Berechtigungsverweigerungsregel, die ein Tool in der Form mcp__<server>__<tool> benennt, entfernt es aus Claudes Kontext.

Eine lange Werkzeugliste kostet sowohl Genauigkeit als auch Token

Ein großer Katalog hat einen zweiten Preis. In der Dokumentation von Anthropic wird der Punkt angegeben, an dem Claudes Werkzeugauswahl bei 30 bis 50 verfügbaren Werkzeugen zu verschlechtern beginnt. Eine Zurückstellung hilft, da Claude nur die Handvoll sieht, nach denen gesucht wurde, aber ein kleinerer Katalog hilft mehr.

Wenn Sie Server schreiben oder auswählen, weist der Tool-Design-Leitfaden von Anthropic in die gleiche Richtung: Konsolidieren Sie verwandte Vorgänge in einem Tool mit einem action-Parameter anstelle eines Tools pro Aktion, stellen Sie Namen nach Dienst voran (github_, slack_), damit eine Suche eine ganze Gruppe findet, und geben Sie nur die Felder zurück, die der nächste Schritt benötigt. Weniger, umfassendere Tools verkleinern die Definitionen. Schlanke Antworten verkleinern den Teil, der im Transkript verbleibt.

Wenn eine Änderung der Tools den Cache bricht

Prompt-Caching ist eine Präfixübereinstimmung. Auf der Claude-API wird das Präfix in einer festen Reihenfolge erstellt: tools, dann system, dann messages. Wenn Sie den Namen, die Beschreibung oder die Parameter eines Tools ändern, wird der gesamte Cache ungültig. Die nächste Anfrage verarbeitet die gesamte Konversation erneut als neue Eingabe, anstatt sie aus dem Cache zu lesen, wo sie ab September 2026 bei den meisten Modellen ein Zehntel des Eingabepreises gekostet hätte.

In Claude Code hängt dies vom Lademodus ab. Bei zurückgestellten Tools hängt ein Server, der eine Verbindung herstellt, trennt oder seine Toolliste ändert, nur an die Konversation an und das zwischengespeicherte Präfix bleibt bestehen. Wenn die Tools im Voraus geladen werden, werden sie durch jede solche Änderung ungültig und können passieren, ohne dass Sie irgendetwas tun müssen: Der Prozess eines lokalen Servers wird beendet, eine Remote-Sitzung läuft ab, ein Server stellt nach einem vorübergehenden Fehler wieder eine Verbindung her. Änderungen an der MCP-Konfiguration werden beim nächsten Start wirksam. Wenn die Tools also im Voraus geladen werden, ist der günstigste Zeitpunkt zum Hinzufügen oder Entfernen eines Servers zwischen den Sitzungen.

Codex-CLI

Codex CLI hält MCP-Server in ~/.codex/config.toml oder in .codex/config.toml innerhalb eines vertrauenswürdigen Projekts, eine [mcp_servers.<name>]-Tabelle pro Server. Die CLI, die IDE-Erweiterung und die ChatGPT-Desktop-App teilen diese Konfiguration, sodass in allen dreien ein für einen hinzugefügter Server verfügbar ist.

Die Rechnung hat die gleiche Form: Jedes Werkzeug, das Codex zur Verfügung stellt, wird dem Modell beschrieben, und jedes Ergebnis wird in das Transkript aufgenommen. Aktuelle Versionen (0.156, Stand September 2026) verschieben MCP-Definitionen hinter ein Suchtool für die Modelle, die es unterstützen, und listen die Server im Voraus auf. Dieses Verhalten lebt im Open-Source-Code und nicht in der Dokumentation. Behandeln Sie es daher als aktuell und nicht als dauerhaft.

/mcp verbose

Listet in der Codex-TUI die MCP-Tools auf, die diese Sitzung aufrufen kann, mit Serverdiagnose.

/status zeigt die Token-Nutzung und den verbleibenden Kontext der Sitzung an. Die Schalter befinden sich in derselben Konfigurationsdatei:

  • enabled = false schaltet einen Server aus, ohne seinen Eintrag zu löschen.
  • enabled_tools macht nur die von Ihnen aufgelisteten Tools verfügbar und disabled_tools entfernt einige, die nach der Zulassungsliste angewendet werden.
  • tools.<tool>.output_token_limit legt innerhalb der Tabelle eines Servers ein Token-Budget für die Ausgabe eines Tools fest und überschreibt damit die Standardkürzung des Modells.
  • Server, die ein Repository benötigt, gehören in dessen .codex/config.toml, nicht in die globale Datei.

Der Rest der Rechnung

Wenn Tool-Definitionen bei Bedarf geladen und ungenutzte Server deaktiviert sind, bleiben die Dateien, Befehlsausgaben und der Gesprächsverlauf als Kostenfaktoren. capsul steuert die Claude-Code- oder Codex-CLI, bei der Sie bereits angemeldet sind, sendet, was die Aufgabe verlangt, hält Ihr Tokenbudget ein und meldet, was es ausgelassen hat.

capsul ask 'why does the webhook handler retry twice' --budget 3000

Fragen

Verwenden MCP-Server Token, wenn Sie sie nicht aufrufen?

Ja. Beim verzögerten Laden, dem Claude-Code-Standard für unterstützte Modelle ab September 2026, lädt ein inaktiver Server bei jeder Anfrage seine Toolnamen und Anweisungen herunter. Bei deaktivierter Verzögerung werden bei jeder Anfrage der vollständige Name, die Beschreibung und das JSON-Schema jedes Tools angezeigt. Das Ausschalten des Servers für das Projekt führt dazu, dass es auf Null geht.

Wie sehe ich, wie viele Token meine MCP-Tools in Claude Code verwenden?

Führen Sie /context all aus, wodurch das Kontextfenster nach Kategorien unterteilt wird und die Token aufgelistet werden, die jedes geladene MCP-Tool verwendet. /mcp zeigt den Status und die Werkzeuganzahl jedes Servers an. Bei Pro-, Max-, Team- und Enterprise-Plänen zeigt /usage auch den Anteil jedes MCP-Servers an der aktuellen Nutzung an, basierend auf den Anfragen, die seine Ergebnisse übermittelten.

Wie viele MCP-Tools sind zu viele für Claude Code?

In der Dokumentation von Anthropic heißt es, dass Claudes Tool-Auswahl ab 30 bis 50 verfügbaren Tools abnimmt und dass fünf gängige Server etwa 55.000 Token an Definitionen hinzufügen können, wenn alles im Voraus geladen wird. Die Werkzeugsuche, die in Claude Code standardmäßig aktiviert ist, berücksichtigt beides, indem nur die wenigen Werkzeuge geladen werden, die eine Anfrage benötigt. Die einfachste Regel gilt weiterhin: Verbinden Sie in jedem Projekt nur die Server, die das Projekt verwendet.

Unterbricht das Hinzufügen eines MCP-Servers während der Sitzung den Prompt-Cache?

Dies ist der Fall, wenn Werkzeugdefinitionen im Voraus geladen werden, da Werkzeuge am Anfang des zwischengespeicherten Präfixes stehen und jede Änderung an ihnen alles danach ungültig macht. Bei verzögerten Tools, dem Claude-Code-Standard bei unterstützten Modellen, hängt ein Server, der eine Verbindung herstellt oder trennt, nur Inhalte an und der Cache bleibt bestehen. Konfigurationsänderungen werden beim nächsten Start wirksam, sodass ein Serverwechsel zwischen Sitzungen keine zusätzlichen Kosten verursacht.

Wo konfiguriert Codex CLI MCP-Server?

In ~/.codex/config.toml eine [mcp_servers.<name>]-Tabelle pro Server oder in .codex/config.toml innerhalb eines vertrauenswürdigen Projekts. Legen Sie enabled = false fest, um einen Server auszuschalten, ohne ihn zu löschen, und verwenden Sie enabled_tools oder disabled_tools, um nur einige seiner Tools verfügbar zu machen. Die Codex-CLI, die IDE-Erweiterung und die ChatGPT-Desktop-App teilen diese Konfiguration.

$ npm i -g @penra/capsul

← Alle Ratgeber