Codex CLI 中的 gpt-5.6-luna:每问 token 数
Luna 是这一 GPT 系列中注重效率的成员,适合范围明确、可重复的编程任务。
实测数字
- 原始 Codex CLI
- 32,100
- 使用 capsul
- 13,600
- 发送的输入减少
- x2.36
- 五项答案校验的通过数,依次为原始代理与 capsul
- 4 / 3
- 每问的输出 token,依次为原始代理与 capsul
- 1,180 / 295
每问的缓存加权输入 token
每问的缓存加权输入 token
90% 区间:×1.91 至 ×3.01
ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。
明确指出文件并提出聚焦的问题,能让它更好地处理查找、小修改和直接的测试。广泛调查可能需要更强的模型或更多探索,两者都会改变会话的消耗。因此基准测试把 token 用量与答案校验并列,而不把低输入量当作完整结果。
这轮 Codex CLI 测试由 ChatGPT 订阅覆盖,没有每次调用的美元成本。请把区间和逐项结果与你预计重复的工作对照。某一个问题上的差异,并不能证明整个代码库都存在相同差异。
逐项问题
针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。
| 问题 | 原始代理 | capsul | 减少的输入 | 正确运行次数:原始 / capsul |
|---|---|---|---|---|
| 问题 1 | 39,200 | 13,300 | x2.96 | 2 / 0 |
| 问题 2 | 30,600 | 14,500 | x2.11 | 2 / 2 |
| 问题 3 | 21,200 | 12,700 | x1.66 | 2 / 2 |
| 问题 4 | 48,000 | 19,800 | x2.43 | 0 / 0 |
| 问题 5 | 21,800 | 7,800 | x2.80 | 2 / 2 |
测量方法
同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。
20 / 20 cells · /benchmarks/2026-09-04-codex.json
常见问题
Codex CLI 中的 gpt-5.6-luna 每问使用多少 token?
在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.6-luna 时,每个单行编程问题平均发送 32,100 个缓存加权输入 token;使用 capsul 后为 13,600 个。
gpt-5.6-luna 的节省有统计依据吗?
有。90% 区间为 ×1.91 至 ×3.01,整体高于一,共测得 20 个单元格。
capsul 会改变 gpt-5.6-luna 的答案吗?
通过的校验更少:直接运行时为五项中的 4 项,使用 capsul 时为 3 项。基准测试如实公布了这一结果。