Codex CLI 中的 gpt-5.4:每问 token 数
这一较早的 GPT 模型,是 Codex CLI 编程会话的另一个参照点。
实测数字
- 原始 Codex CLI
- 31,800
- 使用 capsul
- 8,220
- 发送的输入减少
- x3.86
- 五项答案校验的通过数,依次为原始代理与 capsul
- 4 / 4
- 每问的输出 token,依次为原始代理与 capsul
- 1,660 / 467
每问的缓存加权输入 token
每问的缓存加权输入 token
90% 区间:×2.88 至 ×5.47
ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。
即使模型很熟悉,代理回答前读取多少内容,也会让输入量有很大差别。下方测量保持编程问题不变,只改变提供上下文的方式。因此可以据此判断 token 流量,而不必从模型名称猜测。
这轮订阅测试不报告每问的美元金额。请把区间、答案校验和各项任务一起看。若你用它处理更大范围的修改或更长的对话,这些会话累积的输入值得单独测量。
逐项问题
针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。
| 问题 | 原始代理 | capsul | 减少的输入 | 正确运行次数:原始 / capsul |
|---|---|---|---|---|
| 问题 1 | 36,800 | 10,400 | x3.53 | 0 / 0 |
| 问题 2 | 30,600 | 5,970 | x5.12 | 2 / 2 |
| 问题 3 | 17,000 | 3,310 | x5.12 | 1 / 2 |
| 问题 4 | 56,000 | 15,900 | x3.53 | 2 / 2 |
| 问题 5 | 18,500 | 5,520 | x3.35 | 2 / 2 |
测量方法
同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。
20 / 20 cells · /benchmarks/2026-09-04-codex.json
常见问题
Codex CLI 中的 gpt-5.4 每问使用多少 token?
在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.4 时,每个单行编程问题平均发送 31,800 个缓存加权输入 token;使用 capsul 后为 8,220 个。
gpt-5.4 的节省有统计依据吗?
有。90% 区间为 ×2.88 至 ×5.47,整体高于一,共测得 20 个单元格。
capsul 会改变 gpt-5.4 的答案吗?
在本测试中没有:gpt-5.4 直接运行时通过五项答案校验中的 4 项,使用 capsul 时通过 4 项。