$ banc capsul

Mesuré, y compris ce que l'économie a coûté.

Chaque chiffre vient d'un relevé reproductible. Les intervalles sont à côté des médianes, et les lignes où une vérification de réponse a été perdue le disent sur la ligne, pas dans une note.

/banc · septembre 2026

Mesuré avec Claude et Codex.

58%de contexte en moins envoyé au modèleMême question, même modèle. La pile courte est le rapport mesuré, pas une illustration : c'est l'économie médiane sur les neuf modèles ci-dessous.

Ce qui part vraiment sur le fil, modèle par modèle.

Les mêmes cinq questions courtes, au même modèle, avec et sans capsul. Les barres montrent la réduction de l’entrée pondérée par le cache. Les campagnes sont distinctes ; le gain varie avec la tâche et le cache.

part de l'entrée que capsul n'envoie pas

économisés par capsulencore envoyés= claude -p

  • Haiku 4.5

    −73 %

    claude -p
    396 725
    capsul
    106 491
  • Sonnet 5

    −50 %

    claude -p
    244 486
    capsul
    123 370
  • Sonnet 4.6

    −51 %

    claude -p
    147 746
    capsul
    72 692
  • Opus 4.6

    −59 %

    claude -p
    171 370
    capsul
    70 482
  • Opus 4.7

    −32 %

    claude -p
    185 278
    capsul
    126 413
  • Opus 4.8

    −80 %

    claude -p
    358 993
    capsul
    70 478
  • Opus 5

    −58 %

    claude -p
    189 342
    capsul
    79 166
  • Fable 5

    −45 %

    claude -p
    160 682
    capsul
    88 530
  • Fable 5.1

    −58 %

    claude -p
    224 278
    capsul
    95 064

Méthode

Deux bras, le même modèle imposé aux deux. Le bras nu lance le CLI de l'agent comme n'importe qui le lance ; le bras capsul envoie la même question par capsul sur le même modèle. Comparer deux modèles différents reviendrait à comparer des tarifs, pas des outils.

L'unité est l'entrée pondérée par le cache : token frais à plein poids, lecture de cache au dixième. Sur un abonnement, le token brut n'est pas ce qui est décompté, et un décompte brut flatte celui des deux bras qui met le mieux en cache.

Chaque cellule est conservée. Rien n'est écarté parce que le résultat dérange, et chaque campagne indique combien de cellules ont été lancées et combien ont été écartées. Ce second nombre vaut zéro.

Les intervalles sont obtenus par bootstrap à 90 % et dessinés sur le même axe que le gain, avec le trait du ×1 visible en dessous. Un intervalle qui franchit ce trait signifie que la mesure n'établit rien, et il est fait pour se voir.

Ce que ces chiffres ne disent pas

  • Une médiane n'est pas une promesse. Les neuf médianes par modèle vont de ×1,47 à ×5,09, et à modèle constant une question peut gagner un facteur 3 quand la suivante perd.
  • Trois des neuf modèles Claude perdent une vérification de réponse sur cinq avec capsul, et un en gagne une. Une économie payée d'une réponse fausse n'est pas une économie : le compte est donc donné ici plutôt qu'omis.
  • Le protocole est fait de questions courtes d'une ligne, là où le gain est le plus large. Un relevé du même jour sur des prompts de dix lignes, 126 cellules, donne ×1,09 à ×3,34 dont deux lignes qui n'établissent rien. Si vous écrivez des prompts longs, c'est ce relevé qui vous décrit, pas ce tableau. Au moins une tâche publiée consomme par ailleurs plus d'entrée pondérée avec capsul que sans.
  • Les campagnes sont distinctes. Des chiffres de dates différentes ont été mesurés sur des versions différentes du code : une ligne se compare à sa propre campagne, pas nécessairement à une autre.
  • Ces chiffres mesurent l'entrée envoyée à un modèle. Ils ne mesurent pas ce que cela représente d'un quota d'abonnement, qui dépend de pondérations que nous ne maîtrisons pas.

Les données brutes

La campagne la plus récente est publiée en JSON, avec son protocole et ses chiffres tâche par tâche. Qui ne nous croit pas sur parole peut lire le fichier.

Télécharger le jeu de données (JSON)

Lire les guides