$ banco de capsul
Medido, incluido lo que costó el ahorro.
Cada cifra viene de una ejecución reproducible. Los intervalos van junto a las medianas, y las filas donde se perdió una comprobación de respuesta lo dicen en la fila, no en una nota al pie.
/benchmark · septiembre de 2026
Medido con Claude y Codex.
Lo que realmente sale por el cable, modelo a modelo.
Las mismas cinco preguntas breves, al mismo modelo, con y sin capsul. Las barras muestran la reducción de la entrada ponderada por la caché. Son campañas distintas; el ahorro varía según la tarea y la caché.
parte de la entrada que capsul no envía
ahorrados por capsulaún enviados= claude -p
Haiku 4.5
−73 %
- claude -p
- 396 725
- capsul
- 106 491
Sonnet 5
−50 %
- claude -p
- 244 486
- capsul
- 123 370
Sonnet 4.6
−51 %
- claude -p
- 147 746
- capsul
- 72 692
Opus 4.6
−59 %
- claude -p
- 171 370
- capsul
- 70 482
Opus 4.7
−32 %
- claude -p
- 185 278
- capsul
- 126 413
Opus 4.8
−80 %
- claude -p
- 358 993
- capsul
- 70 478
Opus 5
−58 %
- claude -p
- 189 342
- capsul
- 79 166
Fable 5
−45 %
- claude -p
- 160 682
- capsul
- 88 530
Fable 5.1
−58 %
- claude -p
- 224 278
- capsul
- 95 064
Método
Dos brazos, con el mismo modelo impuesto a ambos. El brazo desnudo lanza la CLI del agente tal como la lanza cualquiera; el brazo capsul envía la misma pregunta a través de capsul al mismo modelo. Comparar dos modelos distintos sería comparar tarifas, no herramientas.
La unidad es la entrada ponderada por caché: token nuevo con peso completo, lectura de caché a una décima parte. En una suscripción el token bruto no es lo que se contabiliza, y un recuento bruto favorece al brazo que casualmente cachea mejor.
Se conserva cada celda. Nada se descarta por incómodo, y cada campaña indica cuántas celdas se ejecutaron y cuántas se descartaron. Ese segundo número es cero.
Los intervalos se obtienen por bootstrap al 90 por ciento y se dibujan en el mismo eje que la ganancia, con la línea del uno visible debajo. Un intervalo que cruza esa línea significa que la medición no establece nada, y está hecho para verse.
Lo que estas cifras no dicen
- Una mediana no es una promesa. Las nueve medianas por modelo van de x1,47 a x5,09, y dentro de un mismo modelo una pregunta puede ganar un factor tres mientras la siguiente pierde.
- Tres de los nueve modelos Claude pierden una comprobación de respuesta de cada cinco con capsul, y uno gana una. Un ahorro comprado con una respuesta incorrecta no es un ahorro, así que la cuenta se da aquí en lugar de omitirse.
- El protocolo son preguntas cortas de una línea, que es donde la ganancia es mayor. Una tanda del mismo día con prompts de diez líneas, 126 celdas, dio de x1,09 a x3,34 con dos filas que no establecen nada. Si escribes prompts largos, es esa tanda la que te describe y no esta tabla. Además, al menos una tarea publicada consume más entrada ponderada con capsul que sin él.
- Las campañas son distintas. Cifras de fechas diferentes se midieron sobre versiones diferentes del código: una fila se compara con su propia campaña, no necesariamente con otra.
- Estas cifras miden la entrada enviada a un modelo. No miden cuánta cuota de suscripción supone, que depende de ponderaciones que no controlamos.
Los datos en bruto
La campaña más reciente se publica en JSON, con su protocolo y sus cifras tarea por tarea. Quien no nos crea la tabla puede leer el archivo.