Codex CLI 中的 gpt-5.5:每问 token 数
这一较早的 GPT 版本,为 Codex CLI 用户比较更新的系列成员提供了基准。
实测数字
- 原始 Codex CLI
- 47,200
- 使用 capsul
- 8,130
- 发送的输入减少
- x5.81
- 五项答案校验的通过数,依次为原始代理与 capsul
- 4 / 4
- 每问的输出 token,依次为原始代理与 capsul
- 1,500 / 81.2
每问的缓存加权输入 token
每问的缓存加权输入 token
90% 区间:×4.29 至 ×7.89
ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。
模型选择会影响代理处理编程问题的方式,但周围的上下文仍是每次请求的一部分。利用这一行检查 Codex CLI 直接运行和经 capsul 处理同一任务时发送的输入。如果你日常已经可以使用这个模型,这项比较尤其贴近实际。
基准测试记录 token 数和答案校验,而不是 ChatGPT 订阅的美元账单。把差异归因于模型新旧或档位之前,请先比较逐项任务。观察描述的是固定协议下的简短问题,不能代表所有更长的会话。
逐项问题
针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。
| 问题 | 原始代理 | capsul | 减少的输入 | 正确运行次数:原始 / capsul |
|---|---|---|---|---|
| 问题 1 | 63,800 | 8,500 | x7.50 | 0 / 0 |
| 问题 2 | 40,900 | 12,300 | x3.31 | 2 / 2 |
| 问题 3 | 21,500 | 3,700 | x5.79 | 2 / 2 |
| 问题 4 | 83,000 | 10,200 | x8.13 | 2 / 2 |
| 问题 5 | 27,000 | 5,910 | x4.56 | 2 / 2 |
测量方法
同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。
20 / 20 cells · /benchmarks/2026-09-04-codex.json
常见问题
Codex CLI 中的 gpt-5.5 每问使用多少 token?
在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.5 时,每个单行编程问题平均发送 47,200 个缓存加权输入 token;使用 capsul 后为 8,130 个。
gpt-5.5 的节省有统计依据吗?
有。90% 区间为 ×4.29 至 ×7.89,整体高于一,共测得 20 个单元格。
capsul 会改变 gpt-5.5 的答案吗?
在本测试中没有:gpt-5.5 直接运行时通过五项答案校验中的 4 项,使用 capsul 时通过 4 项。