$ banc capsul
Mesuré, y compris ce que l'économie a coûté.
Chaque chiffre vient d'un relevé reproductible. Les intervalles sont à côté des médianes, et les lignes où une vérification de réponse a été perdue le disent sur la ligne, pas dans une note.
/banc · septembre 2026
Mesuré avec Claude et Codex.
Ce qui part vraiment sur le fil, modèle par modèle.
Les mêmes cinq questions courtes, au même modèle, avec et sans capsul. Les barres montrent la réduction de l’entrée pondérée par le cache. Les campagnes sont distinctes ; le gain varie avec la tâche et le cache.
part de l'entrée que capsul n'envoie pas
économisés par capsulencore envoyés= claude -p
Haiku 4.5
−73 %
- claude -p
- 396 725
- capsul
- 106 491
Sonnet 5
−50 %
- claude -p
- 244 486
- capsul
- 123 370
Sonnet 4.6
−51 %
- claude -p
- 147 746
- capsul
- 72 692
Opus 4.6
−59 %
- claude -p
- 171 370
- capsul
- 70 482
Opus 4.7
−32 %
- claude -p
- 185 278
- capsul
- 126 413
Opus 4.8
−80 %
- claude -p
- 358 993
- capsul
- 70 478
Opus 5
−58 %
- claude -p
- 189 342
- capsul
- 79 166
Fable 5
−45 %
- claude -p
- 160 682
- capsul
- 88 530
Fable 5.1
−58 %
- claude -p
- 224 278
- capsul
- 95 064
Méthode
Deux bras, le même modèle imposé aux deux. Le bras nu lance le CLI de l'agent comme n'importe qui le lance ; le bras capsul envoie la même question par capsul sur le même modèle. Comparer deux modèles différents reviendrait à comparer des tarifs, pas des outils.
L'unité est l'entrée pondérée par le cache : token frais à plein poids, lecture de cache au dixième. Sur un abonnement, le token brut n'est pas ce qui est décompté, et un décompte brut flatte celui des deux bras qui met le mieux en cache.
Chaque cellule est conservée. Rien n'est écarté parce que le résultat dérange, et chaque campagne indique combien de cellules ont été lancées et combien ont été écartées. Ce second nombre vaut zéro.
Les intervalles sont obtenus par bootstrap à 90 % et dessinés sur le même axe que le gain, avec le trait du ×1 visible en dessous. Un intervalle qui franchit ce trait signifie que la mesure n'établit rien, et il est fait pour se voir.
Ce que ces chiffres ne disent pas
- Une médiane n'est pas une promesse. Les neuf médianes par modèle vont de ×1,47 à ×5,09, et à modèle constant une question peut gagner un facteur 3 quand la suivante perd.
- Trois des neuf modèles Claude perdent une vérification de réponse sur cinq avec capsul, et un en gagne une. Une économie payée d'une réponse fausse n'est pas une économie : le compte est donc donné ici plutôt qu'omis.
- Le protocole est fait de questions courtes d'une ligne, là où le gain est le plus large. Un relevé du même jour sur des prompts de dix lignes, 126 cellules, donne ×1,09 à ×3,34 dont deux lignes qui n'établissent rien. Si vous écrivez des prompts longs, c'est ce relevé qui vous décrit, pas ce tableau. Au moins une tâche publiée consomme par ailleurs plus d'entrée pondérée avec capsul que sans.
- Les campagnes sont distinctes. Des chiffres de dates différentes ont été mesurés sur des versions différentes du code : une ligne se compare à sa propre campagne, pas nécessairement à une autre.
- Ces chiffres mesurent l'entrée envoyée à un modèle. Ils ne mesurent pas ce que cela représente d'un quota d'abonnement, qui dépend de pondérations que nous ne maîtrisons pas.
Les données brutes
La campagne la plus récente est publiée en JSON, avec son protocole et ses chiffres tâche par tâche. Qui ne nous croit pas sur parole peut lire le fichier.