$ capsul 基准

测出来的结果,连这份节省的代价也一并写上。

这里的每个数字都来自可复现的运行。区间就写在中位数旁边,而丢掉了一项答案校验的那几行,会写在行内,而不是塞进脚注。

/基准测试 · 2026年9月

使用 Claude 和 Codex 实测。

58%发送给模型的上下文减少量同一个问题、同一个模型。这段较短的堆叠是实测比例,不是示意图 它是下方九个模型节省量的中位数。

真正发出去的量,逐个模型来看。

向同一模型提出相同的五个简短问题,分别使用和不使用 capsul。柱状图显示按缓存加权的输入减少比例。各轮测试独立进行,节省幅度随任务和缓存状态而变化。

capsul 不发送的输入占比

capsul 节省仍会发送的部分= claude -p

  • Haiku 4.5

    −73 %

    claude -p
    396 725
    capsul
    106 491
  • Sonnet 5

    −50 %

    claude -p
    244 486
    capsul
    123 370
  • Sonnet 4.6

    −51 %

    claude -p
    147 746
    capsul
    72 692
  • Opus 4.6

    −59 %

    claude -p
    171 370
    capsul
    70 482
  • Opus 4.7

    −32 %

    claude -p
    185 278
    capsul
    126 413
  • Opus 4.8

    −80 %

    claude -p
    358 993
    capsul
    70 478
  • Opus 5

    −58 %

    claude -p
    189 342
    capsul
    79 166
  • Fable 5

    −45 %

    claude -p
    160 682
    capsul
    88 530
  • Fable 5.1

    −58 %

    claude -p
    224 278
    capsul
    95 064

方法

两条臂,强制使用同一个模型。裸臂就是任何人都会用的方式直接启动代理 CLI;capsul 臂把同一个问题经由 capsul 发给同一个模型。比较两个不同的模型,比的是价目表,不是工具。

计量单位是按缓存加权的输入:新鲜 token 全额计入,缓存读取按十分之一计。在订阅制下被扣减的并不是原始 token,而原始计数会偏袒恰好缓存更好的那一臂。

每个单元格都保留。不会因为结果不好看就剔除,每次测量都注明跑了多少个单元格、剔除了多少个。第二个数字是零。

区间由 90% 自助法得到,与增益画在同一根轴上,下方标出 ×1 的横线。区间跨过这条线,就意味着这次测量什么也没能证明,它就是要被看见。

这些数字没有说的事

  • 中位数不是承诺。九个模型各自的中位数从 ×1.47 到 ×5.09,而在同一个模型内部,一个问题可能赢三倍,下一个问题反而更贵。
  • 九个 Claude 模型中有三个在用 capsul 时,五项答案校验里丢掉了一项,另有一个多得到一项。用错误答案换来的节省不是节省,所以这个数字写在这里,而不是被略去。
  • 这套测量用的是一行以内的短问题,也正是增益最大的场景。同一天另一次用十行提示词的测量,共 126 个单元格,结果是 ×1.09 到 ×3.34,其中两行什么也没能证明。如果你写的是长提示词,描述你的是那一次测量,而不是这张表。此外,至少有一项已公布的任务,用 capsul 时消耗的加权输入比不用时更多。
  • 各次测量彼此独立。不同日期的数字是在不同版本的代码上测的:一行只与自己那次测量可比,未必与另一次可比。
  • 这些数字衡量的是发送给模型的输入,而不是它折算成多少订阅额度,后者取决于我们无法左右的加权方式。

原始数据

最近一次测量以 JSON 公布,含协议与逐项任务的数字。不愿只听我们说的人,可以直接读文件。

下载数据集(JSON)

阅读指南