$ capsul 基准
测出来的结果,连这份节省的代价也一并写上。
这里的每个数字都来自可复现的运行。区间就写在中位数旁边,而丢掉了一项答案校验的那几行,会写在行内,而不是塞进脚注。
/基准测试 · 2026年9月
使用 Claude 和 Codex 实测。
真正发出去的量,逐个模型来看。
向同一模型提出相同的五个简短问题,分别使用和不使用 capsul。柱状图显示按缓存加权的输入减少比例。各轮测试独立进行,节省幅度随任务和缓存状态而变化。
capsul 不发送的输入占比
capsul 节省仍会发送的部分= claude -p
Haiku 4.5
−73 %
- claude -p
- 396 725
- capsul
- 106 491
Sonnet 5
−50 %
- claude -p
- 244 486
- capsul
- 123 370
Sonnet 4.6
−51 %
- claude -p
- 147 746
- capsul
- 72 692
Opus 4.6
−59 %
- claude -p
- 171 370
- capsul
- 70 482
Opus 4.7
−32 %
- claude -p
- 185 278
- capsul
- 126 413
Opus 4.8
−80 %
- claude -p
- 358 993
- capsul
- 70 478
Opus 5
−58 %
- claude -p
- 189 342
- capsul
- 79 166
Fable 5
−45 %
- claude -p
- 160 682
- capsul
- 88 530
Fable 5.1
−58 %
- claude -p
- 224 278
- capsul
- 95 064
方法
两条臂,强制使用同一个模型。裸臂就是任何人都会用的方式直接启动代理 CLI;capsul 臂把同一个问题经由 capsul 发给同一个模型。比较两个不同的模型,比的是价目表,不是工具。
计量单位是按缓存加权的输入:新鲜 token 全额计入,缓存读取按十分之一计。在订阅制下被扣减的并不是原始 token,而原始计数会偏袒恰好缓存更好的那一臂。
每个单元格都保留。不会因为结果不好看就剔除,每次测量都注明跑了多少个单元格、剔除了多少个。第二个数字是零。
区间由 90% 自助法得到,与增益画在同一根轴上,下方标出 ×1 的横线。区间跨过这条线,就意味着这次测量什么也没能证明,它就是要被看见。
这些数字没有说的事
- 中位数不是承诺。九个模型各自的中位数从 ×1.47 到 ×5.09,而在同一个模型内部,一个问题可能赢三倍,下一个问题反而更贵。
- 九个 Claude 模型中有三个在用 capsul 时,五项答案校验里丢掉了一项,另有一个多得到一项。用错误答案换来的节省不是节省,所以这个数字写在这里,而不是被略去。
- 这套测量用的是一行以内的短问题,也正是增益最大的场景。同一天另一次用十行提示词的测量,共 126 个单元格,结果是 ×1.09 到 ×3.34,其中两行什么也没能证明。如果你写的是长提示词,描述你的是那一次测量,而不是这张表。此外,至少有一项已公布的任务,用 capsul 时消耗的加权输入比不用时更多。
- 各次测量彼此独立。不同日期的数字是在不同版本的代码上测的:一行只与自己那次测量可比,未必与另一次可比。
- 这些数字衡量的是发送给模型的输入,而不是它折算成多少订阅额度,后者取决于我们无法左右的加权方式。
原始数据
最近一次测量以 JSON 公布,含协议与逐项任务的数字。不愿只听我们说的人,可以直接读文件。