Codex CLI の gpt-5.4-mini:質問あたりのトークン

Mini は以前の GPT 系列の小型モデルで、範囲が明確なコーディングに向いています。

測定結果

通常の Codex CLI
42,300

質問あたりのキャッシュ加重入力トークン

capsul 使用時
12,100

質問あたりのキャッシュ加重入力トークン

送信した入力の削減量
x3.49

90% 区間:×3.05 〜 ×4.03

5 項目の回答チェック通過数。通常、capsul の順
3 / 4
質問あたりの出力トークン。通常、capsul の順
2,390 / 904

ChatGPT プラン上の Codex CLI が報告するのはトークン数で、ドル額ではありません。GPT モデルのコストは表示しません。

コードの場所を探す、機械的な変更を加える、絞ったテスト失敗を確認するといった用途の候補です。ただし、再試行や追加の探索が必要なら、小型モデルが正解までの最安の道筋とは限りません。だからこそ、トークン数と回答チェックを一緒に見る必要があります。

今回は Codex CLI を ChatGPT サブスクリプションで使ったため、ページではトークンをドルに換算しません。個々の質問から、うまく処理した仕事とできなかった仕事が分かります。区間も併せて見て、自分の作業に結果を当てはめられるか判断してください。

質問ごとの結果

実際の TypeScript コードベースに関する 1 行の質問を 5 つ用意し、質問ごとに各比較条件で 2 回反復。表は質問あたりの加重入力の平均値です。

質問通常capsul入力削減量正解回数:通常 / capsul
質問 145,70011,500x3.971 / 0
質問 235,60021,800x1.632 / 2
質問 37,9207,110x1.110 / 2
質問 481,20010,400x7.780 / 2
質問 541,2009,770x4.222 / 2

測定方法

同じモデルで 2 条件を比較します。通常どおり Codex CLI を実行した場合と、同じ質問を capsul 経由で送った場合です。単位はキャッシュ加重入力で、新規トークンは全量、キャッシュ読み取りは 10 分の 1 として計算。測定日は 2026年9月4日、質問と条件ごとに 2 回反復しました。

20 / 20 cells · /benchmarks/2026-09-04-codex.json

よくある質問

Codex CLI の gpt-5.4-mini は質問ごとに何トークン使いますか?

2026年9月4日 のベンチマークでは、Codex CLI で gpt-5.4-mini を通常どおり使うと、1 行のコーディング質問あたり平均 42,300 キャッシュ加重入力トークンを送信しました。capsul 使用時は 12,100 です。

gpt-5.4-mini の削減効果は確かですか?

はい。90% 区間は ×3.05 から ×4.03 で、全体が 1 を上回っています。測定したセル数は 20 です。

capsul は gpt-5.4-mini の回答を変えますか?

通過数は増えました。通常時は 5 項目中 3 項目、capsul 使用時は 4 項目です。5 項目は少数なので、改善と断定せず、低下がなかったと読んでください。