$ capsul Benchmark

Gemessen, samt dem, was die Einsparung gekostet hat.

Jede Zahl hier stammt aus einem reproduzierbaren Lauf. Die Intervalle stehen neben den Medianen, und die Zeilen, in denen eine Antwortprüfung verloren ging, sagen das in der Zeile und nicht in einer Fußnote.

/Benchmark · September 2026

Mit Claude und Codex gemessen.

58%weniger Kontext an das Modell geschicktGleiche Frage, gleiches Modell. Der kurze Stapel ist das gemessene Verhältnis, keine Illustration: Es ist die mediane Ersparnis über die neun Modelle unten.

Was tatsächlich über die Leitung geht, Modell für Modell.

Dieselben fünf kurzen Fragen an dasselbe Modell, mit und ohne capsul. Die Balken zeigen die Reduktion der nach Cache gewichteten Eingabe. Die Messreihen sind getrennt; die Ersparnis hängt von Aufgabe und Cache ab.

Anteil der Eingabe, den capsul nicht sendet

von capsul gesparttrotzdem gesendet= claude -p

  • Haiku 4.5

    −73 %

    claude -p
    396 725
    capsul
    106 491
  • Sonnet 5

    −50 %

    claude -p
    244 486
    capsul
    123 370
  • Sonnet 4.6

    −51 %

    claude -p
    147 746
    capsul
    72 692
  • Opus 4.6

    −59 %

    claude -p
    171 370
    capsul
    70 482
  • Opus 4.7

    −32 %

    claude -p
    185 278
    capsul
    126 413
  • Opus 4.8

    −80 %

    claude -p
    358 993
    capsul
    70 478
  • Opus 5

    −58 %

    claude -p
    189 342
    capsul
    79 166
  • Fable 5

    −45 %

    claude -p
    160 682
    capsul
    88 530
  • Fable 5.1

    −58 %

    claude -p
    224 278
    capsul
    95 064

Methode

Zwei Arme, beiden dasselbe Modell vorgegeben. Der nackte Arm startet die Agenten-CLI so, wie jede und jeder sie startet; der capsul-Arm schickt dieselbe Frage über capsul an dasselbe Modell. Zwei verschiedene Modelle zu vergleichen hieße, Preislisten zu vergleichen, nicht Werkzeuge.

Die Einheit ist die cache-gewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesevorgänge mit einem Zehntel. Bei einem Abonnement wird nicht der rohe Token abgerechnet, und eine rohe Zählung schmeichelt dem Arm, der zufällig besser cacht.

Jede Zelle bleibt erhalten. Nichts wird verworfen, weil es unbequem ist, und jede Kampagne nennt, wie viele Zellen gelaufen und wie viele verworfen wurden. Die zweite Zahl ist null.

Die Intervalle stammen aus einem Bootstrap bei 90 Prozent und liegen auf derselben Achse wie der Gewinn, mit der Linie bei eins darunter. Ein Intervall, das diese Linie schneidet, belegt nichts, und genau das soll man sehen.

Was diese Zahlen nicht sagen

  • Ein Median ist kein Versprechen. Die neun Modell-Mediane reichen von x1,47 bis x5,09, und bei gleichem Modell kann eine Frage den Faktor drei gewinnen, während die nächste verliert.
  • Drei der neun Claude-Modelle verlieren mit capsul eine von fünf Antwortprüfungen, eines gewinnt eine hinzu. Eine mit einer falschen Antwort erkaufte Einsparung ist keine Einsparung, deshalb steht die Zahl hier und wird nicht weggelassen.
  • Das Protokoll besteht aus kurzen, einzeiligen Fragen, wo der Gewinn am größten ist. Ein Lauf vom selben Tag mit zehnzeiligen Prompts, 126 Zellen, ergab x1,09 bis x3,34, wobei zwei Zeilen nichts belegten. Wer lange Prompts schreibt, wird von jenem Lauf beschrieben und nicht von dieser Tabelle. Mindestens eine veröffentlichte Aufgabe verbraucht mit capsul zudem mehr gewichtete Eingabe als ohne.
  • Die Kampagnen sind getrennt. Zahlen von verschiedenen Daten wurden auf verschiedenen Codeständen gemessen: eine Zeile ist mit ihrer eigenen Kampagne vergleichbar, nicht zwingend mit einer anderen.
  • Diese Zahlen messen die an ein Modell gesendete Eingabe. Sie messen nicht, wie viel Abonnementkontingent daraus wird; das hängt von Gewichtungen ab, die wir nicht kontrollieren.

Die Rohdaten

Die jüngste Kampagne ist als JSON veröffentlicht, mit Protokoll und den Zahlen je Aufgabe. Wer uns die Tabelle nicht glaubt, kann die Datei lesen.

Datensatz herunterladen (JSON)

Ratgeber lesen