Codex CLI 中的 gpt-5.6-luna:每问 token 数

Luna 是这一 GPT 系列中注重效率的成员,适合范围明确、可重复的编程任务。

实测数字

原始 Codex CLI
32,100

每问的缓存加权输入 token

使用 capsul
13,600

每问的缓存加权输入 token

发送的输入减少
x2.36

90% 区间:×1.91 至 ×3.01

五项答案校验的通过数,依次为原始代理与 capsul
4 / 3
每问的输出 token,依次为原始代理与 capsul
1,180 / 295

ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。

明确指出文件并提出聚焦的问题,能让它更好地处理查找、小修改和直接的测试。广泛调查可能需要更强的模型或更多探索,两者都会改变会话的消耗。因此基准测试把 token 用量与答案校验并列,而不把低输入量当作完整结果。

这轮 Codex CLI 测试由 ChatGPT 订阅覆盖,没有每次调用的美元成本。请把区间和逐项结果与你预计重复的工作对照。某一个问题上的差异,并不能证明整个代码库都存在相同差异。

逐项问题

针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。

问题原始代理capsul减少的输入正确运行次数:原始 / capsul
问题 139,20013,300x2.962 / 0
问题 230,60014,500x2.112 / 2
问题 321,20012,700x1.662 / 2
问题 448,00019,800x2.430 / 0
问题 521,8007,800x2.802 / 2

测量方法

同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。

20 / 20 cells · /benchmarks/2026-09-04-codex.json

常见问题

Codex CLI 中的 gpt-5.6-luna 每问使用多少 token?

在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.6-luna 时,每个单行编程问题平均发送 32,100 个缓存加权输入 token;使用 capsul 后为 13,600 个。

gpt-5.6-luna 的节省有统计依据吗?

有。90% 区间为 ×1.91 至 ×3.01,整体高于一,共测得 20 个单元格。

capsul 会改变 gpt-5.6-luna 的答案吗?

通过的校验更少:直接运行时为五项中的 4 项,使用 capsul 时为 3 项。基准测试如实公布了这一结果。