Codex CLI の gpt-5.5:質問あたりのトークン

以前の GPT 版であり、Codex CLI の利用者が新しい系列と比べる際の基準になります。

測定結果

通常の Codex CLI
47,200

質問あたりのキャッシュ加重入力トークン

capsul 使用時
8,130

質問あたりのキャッシュ加重入力トークン

送信した入力の削減量
x5.81

90% 区間:×4.29 〜 ×7.89

5 項目の回答チェック通過数。通常、capsul の順
4 / 4
質問あたりの出力トークン。通常、capsul の順
1,500 / 81.2

ChatGPT プラン上の Codex CLI が報告するのはトークン数で、ドル額ではありません。GPT モデルのコストは表示しません。

モデルによってコーディング質問への取り組み方は変わりますが、周囲のコンテキストも毎回のリクエストに含まれます。この行では、通常の Codex CLI と、同じタスクに capsul を使った場合の送信入力を確認できます。普段からこのモデルを使える環境なら、特に参考になります。

ベンチマークが記録するのはトークンと回答チェックで、ChatGPT サブスクリプションのドル請求額ではありません。差をモデルの世代や階層に帰する前に、タスクごとの行を比べてください。観測対象は固定した条件の短い質問であり、より長いすべてのセッションではありません。

質問ごとの結果

実際の TypeScript コードベースに関する 1 行の質問を 5 つ用意し、質問ごとに各比較条件で 2 回反復。表は質問あたりの加重入力の平均値です。

質問通常capsul入力削減量正解回数:通常 / capsul
質問 163,8008,500x7.500 / 0
質問 240,90012,300x3.312 / 2
質問 321,5003,700x5.792 / 2
質問 483,00010,200x8.132 / 2
質問 527,0005,910x4.562 / 2

測定方法

同じモデルで 2 条件を比較します。通常どおり Codex CLI を実行した場合と、同じ質問を capsul 経由で送った場合です。単位はキャッシュ加重入力で、新規トークンは全量、キャッシュ読み取りは 10 分の 1 として計算。測定日は 2026年9月4日、質問と条件ごとに 2 回反復しました。

20 / 20 cells · /benchmarks/2026-09-04-codex.json

よくある質問

Codex CLI の gpt-5.5 は質問ごとに何トークン使いますか?

2026年9月4日 のベンチマークでは、Codex CLI で gpt-5.5 を通常どおり使うと、1 行のコーディング質問あたり平均 47,200 キャッシュ加重入力トークンを送信しました。capsul 使用時は 8,130 です。

gpt-5.5 の削減効果は確かですか?

はい。90% 区間は ×4.29 から ×7.89 で、全体が 1 を上回っています。測定したセル数は 20 です。

capsul は gpt-5.5 の回答を変えますか?

この測定条件では変化はありません。gpt-5.5 は通常時に 5 項目中 4 項目、capsul 使用時に 4 項目の回答チェックに通過しました。