Codex CLI 中的 gpt-5.4-mini:每问 token 数

Mini 是这一较早 GPT 系列中的小型成员,适合边界清晰的编程工作。

实测数字

原始 Codex CLI
42,300

每问的缓存加权输入 token

使用 capsul
12,100

每问的缓存加权输入 token

发送的输入减少
x3.49

90% 区间:×3.05 至 ×4.03

五项答案校验的通过数,依次为原始代理与 capsul
3 / 4
每问的输出 token,依次为原始代理与 capsul
2,390 / 904

ChatGPT 套餐下,Codex CLI 报告 token 数,不报告美元费用,因此 GPT 模型不显示成本。

查找代码、完成机械修改或检查单个测试失败,都可以考虑它。但如果需要反复尝试或额外探索,小模型未必是得到正确答案时成本最低的路径。因此答案校验必须与 token 数并列阅读。

这轮 Codex CLI 运行使用 ChatGPT 订阅,页面不会把 token 换算成美元。各个问题显示了它在哪些任务上完成要求,在哪些任务上没有。请结合区间,再判断测得的结果能否用于自己的工作流。

逐项问题

针对真实 TypeScript 代码库提出五个单行问题,每条对照臂的每个问题重复 2 次。表中为每问加权输入的平均值。

问题原始代理capsul减少的输入正确运行次数:原始 / capsul
问题 145,70011,500x3.971 / 0
问题 235,60021,800x1.632 / 2
问题 37,9207,110x1.110 / 2
问题 481,20010,400x7.780 / 2
问题 541,2009,770x4.222 / 2

测量方法

同一个模型的两条对照臂:直接运行 Codex CLI,以及通过 capsul 提交同一个问题。计量单位为缓存加权输入:新 token 全额计算,缓存读取按十分之一计算。测量日期为 2026年9月4日,每个问题在每条臂上重复 2 次。

20 / 20 cells · /benchmarks/2026-09-04-codex.json

常见问题

Codex CLI 中的 gpt-5.4-mini 每问使用多少 token?

在 2026年9月4日 的基准测试中,Codex CLI 直接运行 gpt-5.4-mini 时,每个单行编程问题平均发送 42,300 个缓存加权输入 token;使用 capsul 后为 12,100 个。

gpt-5.4-mini 的节省有统计依据吗?

有。90% 区间为 ×3.05 至 ×4.03,整体高于一,共测得 20 个单元格。

capsul 会改变 gpt-5.4-mini 的答案吗?

通过的校验更多:直接运行时为五项中的 3 项,使用 capsul 时为 4 项。五项样本很小,应理解为没有损失,而非确立了提升。