Codex CLI の gpt-5.6-sol:質問あたりのトークン

Sol は Codex CLI で使うこの GPT 系列の最上位モデルで、難しいコーディング向けです。

測定結果

通常の Codex CLI
33,100

質問あたりのキャッシュ加重入力トークン

capsul 使用時
14,700

質問あたりのキャッシュ加重入力トークン

送信した入力の削減量
x2.26

90% 区間:×1.81 〜 ×3.01

5 項目の回答チェック通過数。通常、capsul の順
3 / 3
質問あたりの出力トークン。通常、capsul の順
1,020 / 225

ChatGPT プラン上の Codex CLI が報告するのはトークン数で、ドル額ではありません。GPT モデルのコストは表示しません。

原因の曖昧なバグ、複雑な実装、継続的な判断が要るレビューに適しています。こうした仕事ではファイルを広く調べることも多いため、モデルの選択と併せて送信する入力にも注目してください。下の数値は、同じ短い質問を通常の Codex CLI と capsul 使用時で比較しています。

今回は ChatGPT サブスクリプションを使ったため、質問あたりのドル額ではなくトークンを報告しています。測定差を理由に作業方法を変える前に、区間と回答チェックを見てください。長いプロジェクトでは、これらの短い質問と異なる形でコンテキストが積み重なります。

質問ごとの結果

実際の TypeScript コードベースに関する 1 行の質問を 5 つ用意し、質問ごとに各比較条件で 2 回反復。表は質問あたりの加重入力の平均値です。

質問通常capsul入力削減量正解回数:通常 / capsul
質問 136,00019,200x1.880 / 0
質問 223,9009,850x2.431 / 2
質問 324,6007,830x3.142 / 2
質問 461,40021,900x2.800 / 0
質問 519,40014,500x1.342 / 2

測定方法

同じモデルで 2 条件を比較します。通常どおり Codex CLI を実行した場合と、同じ質問を capsul 経由で送った場合です。単位はキャッシュ加重入力で、新規トークンは全量、キャッシュ読み取りは 10 分の 1 として計算。測定日は 2026年9月4日、質問と条件ごとに 2 回反復しました。

20 / 20 cells · /benchmarks/2026-09-04-codex.json

よくある質問

Codex CLI の gpt-5.6-sol は質問ごとに何トークン使いますか?

2026年9月4日 のベンチマークでは、Codex CLI で gpt-5.6-sol を通常どおり使うと、1 行のコーディング質問あたり平均 33,100 キャッシュ加重入力トークンを送信しました。capsul 使用時は 14,700 です。

gpt-5.6-sol の削減効果は確かですか?

はい。90% 区間は ×1.81 から ×3.01 で、全体が 1 を上回っています。測定したセル数は 20 です。

capsul は gpt-5.6-sol の回答を変えますか?

この測定条件では変化はありません。gpt-5.6-sol は通常時に 5 項目中 3 項目、capsul 使用時に 3 項目の回答チェックに通過しました。