$ capsul Benchmark
Gemessen, samt dem, was die Einsparung gekostet hat.
Jede Zahl hier stammt aus einem reproduzierbaren Lauf. Die Intervalle stehen neben den Medianen, und die Zeilen, in denen eine Antwortprüfung verloren ging, sagen das in der Zeile und nicht in einer Fußnote.
/Benchmark · September 2026
Mit Claude und Codex gemessen.
Was tatsächlich über die Leitung geht, Modell für Modell.
Dieselben fünf kurzen Fragen an dasselbe Modell, mit und ohne capsul. Die Balken zeigen die Reduktion der nach Cache gewichteten Eingabe. Die Messreihen sind getrennt; die Ersparnis hängt von Aufgabe und Cache ab.
Anteil der Eingabe, den capsul nicht sendet
von capsul gesparttrotzdem gesendet= claude -p
Haiku 4.5
−73 %
- claude -p
- 396 725
- capsul
- 106 491
Sonnet 5
−50 %
- claude -p
- 244 486
- capsul
- 123 370
Sonnet 4.6
−51 %
- claude -p
- 147 746
- capsul
- 72 692
Opus 4.6
−59 %
- claude -p
- 171 370
- capsul
- 70 482
Opus 4.7
−32 %
- claude -p
- 185 278
- capsul
- 126 413
Opus 4.8
−80 %
- claude -p
- 358 993
- capsul
- 70 478
Opus 5
−58 %
- claude -p
- 189 342
- capsul
- 79 166
Fable 5
−45 %
- claude -p
- 160 682
- capsul
- 88 530
Fable 5.1
−58 %
- claude -p
- 224 278
- capsul
- 95 064
Methode
Zwei Arme, beiden dasselbe Modell vorgegeben. Der nackte Arm startet die Agenten-CLI so, wie jede und jeder sie startet; der capsul-Arm schickt dieselbe Frage über capsul an dasselbe Modell. Zwei verschiedene Modelle zu vergleichen hieße, Preislisten zu vergleichen, nicht Werkzeuge.
Die Einheit ist die cache-gewichtete Eingabe: frische Tokens mit vollem Gewicht, Cache-Lesevorgänge mit einem Zehntel. Bei einem Abonnement wird nicht der rohe Token abgerechnet, und eine rohe Zählung schmeichelt dem Arm, der zufällig besser cacht.
Jede Zelle bleibt erhalten. Nichts wird verworfen, weil es unbequem ist, und jede Kampagne nennt, wie viele Zellen gelaufen und wie viele verworfen wurden. Die zweite Zahl ist null.
Die Intervalle stammen aus einem Bootstrap bei 90 Prozent und liegen auf derselben Achse wie der Gewinn, mit der Linie bei eins darunter. Ein Intervall, das diese Linie schneidet, belegt nichts, und genau das soll man sehen.
Was diese Zahlen nicht sagen
- Ein Median ist kein Versprechen. Die neun Modell-Mediane reichen von x1,47 bis x5,09, und bei gleichem Modell kann eine Frage den Faktor drei gewinnen, während die nächste verliert.
- Drei der neun Claude-Modelle verlieren mit capsul eine von fünf Antwortprüfungen, eines gewinnt eine hinzu. Eine mit einer falschen Antwort erkaufte Einsparung ist keine Einsparung, deshalb steht die Zahl hier und wird nicht weggelassen.
- Das Protokoll besteht aus kurzen, einzeiligen Fragen, wo der Gewinn am größten ist. Ein Lauf vom selben Tag mit zehnzeiligen Prompts, 126 Zellen, ergab x1,09 bis x3,34, wobei zwei Zeilen nichts belegten. Wer lange Prompts schreibt, wird von jenem Lauf beschrieben und nicht von dieser Tabelle. Mindestens eine veröffentlichte Aufgabe verbraucht mit capsul zudem mehr gewichtete Eingabe als ohne.
- Die Kampagnen sind getrennt. Zahlen von verschiedenen Daten wurden auf verschiedenen Codeständen gemessen: eine Zeile ist mit ihrer eigenen Kampagne vergleichbar, nicht zwingend mit einer anderen.
- Diese Zahlen messen die an ein Modell gesendete Eingabe. Sie messen nicht, wie viel Abonnementkontingent daraus wird; das hängt von Gewichtungen ab, die wir nicht kontrollieren.
Die Rohdaten
Die jüngste Kampagne ist als JSON veröffentlicht, mit Protokoll und den Zahlen je Aufgabe. Wer uns die Tabelle nicht glaubt, kann die Datei lesen.