Codex CLI 中的 gpt-5.6-sol:每问 token 数
Sol 是 Codex CLI 中这一 GPT 系列的旗舰成员,面向要求较高的编程工作。
实测数字
- 原始 Codex CLI
- 33,100
- 使用 capsul
- 14,700
- 发送的输入减少
- x2.26
- 五项答案校验的通过数,依次为原始代理与 capsul
- 3 / 3
- 每问的输出 token,依次为原始代理与 capsul
- 1,020 / 225
每问的缓存加权输入 token
每问的缓存加权输入 token
90% 区间:×1.81 至 ×3.01
ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。
模糊的故障、复杂实现或需要持续判断的审查,都可以考虑这一档位。这些任务也常促使代理广泛查阅文件,因此除了选什么模型,还要看代理发送了多少输入。下方数据对比了 Codex CLI 直接运行与使用 capsul 时回答同一批简短问题的情况。
这轮测试使用 ChatGPT 订阅,因此页面报告 token 数,而不是每问的美元金额。依据差异改变工作流前,请查看区间和答案校验。长项目累积上下文的方式可能不同于这些简短任务。
逐项问题
针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。
| 问题 | 原始代理 | capsul | 减少的输入 | 正确运行次数:原始 / capsul |
|---|---|---|---|---|
| 问题 1 | 36,000 | 19,200 | x1.88 | 0 / 0 |
| 问题 2 | 23,900 | 9,850 | x2.43 | 1 / 2 |
| 问题 3 | 24,600 | 7,830 | x3.14 | 2 / 2 |
| 问题 4 | 61,400 | 21,900 | x2.80 | 0 / 0 |
| 问题 5 | 19,400 | 14,500 | x1.34 | 2 / 2 |
测量方法
同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。
20 / 20 cells · /benchmarks/2026-09-04-codex.json
常见问题
Codex CLI 中的 gpt-5.6-sol 每问使用多少 token?
在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.6-sol 时,每个单行编程问题平均发送 33,100 个缓存加权输入 token;使用 capsul 后为 14,700 个。
gpt-5.6-sol 的节省有统计依据吗?
有。90% 区间为 ×1.81 至 ×3.01,整体高于一,共测得 20 个单元格。
capsul 会改变 gpt-5.6-sol 的答案吗?
在本测试中没有:gpt-5.6-sol 直接运行时通过五项答案校验中的 3 项,使用 capsul 时通过 3 项。