$ banco de capsul

Medido, incluido lo que costó el ahorro.

Cada cifra viene de una ejecución reproducible. Los intervalos van junto a las medianas, y las filas donde se perdió una comprobación de respuesta lo dicen en la fila, no en una nota al pie.

/benchmark · septiembre de 2026

Medido con Claude y Codex.

58%menos contexto enviado al modeloMisma pregunta, mismo modelo. La pila corta es la proporción medida, no una ilustración: es el ahorro mediano de los nueve modelos de abajo.

Lo que realmente sale por el cable, modelo a modelo.

Las mismas cinco preguntas breves, al mismo modelo, con y sin capsul. Las barras muestran la reducción de la entrada ponderada por la caché. Son campañas distintas; el ahorro varía según la tarea y la caché.

parte de la entrada que capsul no envía

ahorrados por capsulaún enviados= claude -p

  • Haiku 4.5

    −73 %

    claude -p
    396 725
    capsul
    106 491
  • Sonnet 5

    −50 %

    claude -p
    244 486
    capsul
    123 370
  • Sonnet 4.6

    −51 %

    claude -p
    147 746
    capsul
    72 692
  • Opus 4.6

    −59 %

    claude -p
    171 370
    capsul
    70 482
  • Opus 4.7

    −32 %

    claude -p
    185 278
    capsul
    126 413
  • Opus 4.8

    −80 %

    claude -p
    358 993
    capsul
    70 478
  • Opus 5

    −58 %

    claude -p
    189 342
    capsul
    79 166
  • Fable 5

    −45 %

    claude -p
    160 682
    capsul
    88 530
  • Fable 5.1

    −58 %

    claude -p
    224 278
    capsul
    95 064

Método

Dos brazos, con el mismo modelo impuesto a ambos. El brazo desnudo lanza la CLI del agente tal como la lanza cualquiera; el brazo capsul envía la misma pregunta a través de capsul al mismo modelo. Comparar dos modelos distintos sería comparar tarifas, no herramientas.

La unidad es la entrada ponderada por caché: token nuevo con peso completo, lectura de caché a una décima parte. En una suscripción el token bruto no es lo que se contabiliza, y un recuento bruto favorece al brazo que casualmente cachea mejor.

Se conserva cada celda. Nada se descarta por incómodo, y cada campaña indica cuántas celdas se ejecutaron y cuántas se descartaron. Ese segundo número es cero.

Los intervalos se obtienen por bootstrap al 90 por ciento y se dibujan en el mismo eje que la ganancia, con la línea del uno visible debajo. Un intervalo que cruza esa línea significa que la medición no establece nada, y está hecho para verse.

Lo que estas cifras no dicen

  • Una mediana no es una promesa. Las nueve medianas por modelo van de x1,47 a x5,09, y dentro de un mismo modelo una pregunta puede ganar un factor tres mientras la siguiente pierde.
  • Tres de los nueve modelos Claude pierden una comprobación de respuesta de cada cinco con capsul, y uno gana una. Un ahorro comprado con una respuesta incorrecta no es un ahorro, así que la cuenta se da aquí en lugar de omitirse.
  • El protocolo son preguntas cortas de una línea, que es donde la ganancia es mayor. Una tanda del mismo día con prompts de diez líneas, 126 celdas, dio de x1,09 a x3,34 con dos filas que no establecen nada. Si escribes prompts largos, es esa tanda la que te describe y no esta tabla. Además, al menos una tarea publicada consume más entrada ponderada con capsul que sin él.
  • Las campañas son distintas. Cifras de fechas diferentes se midieron sobre versiones diferentes del código: una fila se compara con su propia campaña, no necesariamente con otra.
  • Estas cifras miden la entrada enviada a un modelo. No miden cuánta cuota de suscripción supone, que depende de ponderaciones que no controlamos.

Los datos en bruto

La campaña más reciente se publica en JSON, con su protocolo y sus cifras tarea por tarea. Quien no nos crea la tabla puede leer el archivo.

Descargar el conjunto de datos (JSON)

Leer las guías