Claude Code と Codex CLI: それぞれのトークン使用場所

どちらのエージェントがトークンを少なく使うかは、エージェント自体よりもモデルや設定、タスクに左右されます。ここでは各エージェントが入力トークンをどこに使い、何を表示し、どのように課金され、測定結果が何を示すかを説明します。

Claude Code と Codex CLI は同じ方式で構築された CLI コーディングエージェントです。モデルがループしながらファイルを読み取り、コマンドを実行し、起動したディレクトリ内のコードを編集します。したがってトークンの消費方法も同じです。各リクエストは質問以上の情報を含み、質問はその中で最小の部分です。

どちらがトークンを少なく使うかという短い答えは、どちらも信頼できるほど少なくはありません。選択したモデル、オンにした指示やツール、エージェントの探索量が、エージェントの選択以上に総消費量を左右します。

トークンの行き先(両エージェント共通)

両ツールの各リクエストは、3 つの入力層を含みます:

  • 環境入力: エージェント自身の指示、モデルが呼び出す可能性のあるすべてのツール定義、プロジェクト指示(Claude Code は CLAUDE.md、Codex は AGENTS.md)および有効化されたスキル、プラグイン、MCP サーバー。入力を開始する前から存在します。
  • 探索: 読み込んだファイル、検索結果、コマンド出力はすべて会話に追加され、セッション終了まで保持されます。
  • トランスクリプト: これまでの全会話と各ツールの結果が、各リクエストごとに再送信されます。1 つの質問は通常、エージェントが取るステップごとに複数のリクエストに分かれます。

プロンプトキャッシュは両側のトランスクリプトを軽減します。プロバイダーが事前に処理したプレフィックスはキャッシュ読み取りとして課金され、2026 年 9 月時点の多くのモデルでは新規トークンの 1/10 の料金です(Anthropic と OpenAI の価格表参照)。ウィンドウが満杯になると、両エージェントは履歴を要約に圧縮し、/compact で手動でも実行できます。

入力前に各エージェントがロードするもの

Claude Code は各リクエストを次の順序で構成します: まずコア指示とツール定義、次にプロジェクトコンテキスト(CLAUDE.md、自動メモリ、ルール)、最後に会話です。サポートされているモデルでは MCP ツールはデフォルトで遅延ロードされるため、アイドル状態のサーバーはツール名と指示だけが費用となり、Claude が実際に使用するまで完全なスキーマは送信されません。スキルは呼び出されるまで 1 行の説明だけが費用に含まれます。

Codex CLI は起動時に AGENTS.md ファイルから指示チェーンを構築します。まず Codex のホームディレクトリから、続いてプロジェクトルートから現在のディレクトリまで各ディレクトリごとに 1 つずつ読み込み、デフォルトで 32 KiB までのファイルを追加します。利用可能なスキルのカタログも追加され、トークン予算はモデルのコンテキストウィンドウの 2% がデフォルトです。config.toml の MCP サーバーはツールを提供しますが、モデルがサポートしていれば検索ステップの後で遅延ロードされ、そうでなければ全体が送信されます。enabled_tools と disabled_tools で各サーバーが公開するツールを調整できます。

どちらのリストも固定ではなく、インストール状況に依存します。これが他人のマシンでの比較実行が自分の環境にそのまま当てはまらない第一の理由です。

各エージェントが表示する情報

Claude Code はトークン使用量と概算ドル額を報告します:

/usage

Claude Code はモデル別トークン数、キャッシュ読み書き、定価ベースの概算、サブスクリプションの場合はプラン使用量を表示します。

/context

Claude Code: 現在コンテキストウィンドウを占めているものをカテゴリ別に表示します。

Codex CLI はトークン数を報告し、ChatGPT にサインインしている場合は使用したリミットの割合も表示します:

/status

Codex: 使用中のモデル、使用済み・残りのコンテキストウィンドウ、5 時間および週次リミットの残量を示します。

codex debug prompt-input 'where is the retry limit set'

JSON 形式で、Codex がそのプロンプトに対して送信する入力リストをモデル呼び出しなしで出力します。

Codex の /usage はアカウントのトークン活動を日別、週別、または総計で表示し、終了時にセッションのトークン数を出力します。debug prompt-input の出力は基本指示とツールスキーマを除外するため、全リクエストの下限として捉えてください。

各エージェントの課金方法

両エージェントはサブスクリプションまたはトークン従量課金のいずれかで動作し、課金方式は異なります:

  • Claude Pro または Max 上の Claude Code: 使用量は 5 時間ごとにリセットされるセッションリミットと週次リミットに対してカウントされ、Claude 本体の利用と共有されます。Team および Enterprise プランも同様です。/usage のドル額は定価ベースの概算で、Anthropic は Pro と Max の課金には関係ないとしています。
  • API キーまたは Claude Console 上の Claude Code: API 料金でトークン単位の課金となり、キャッシュ読み書きも含まれます。環境変数に ANTHROPIC_API_KEY が設定されていると、承認後はサブスクリプションに代わって使用され、claude -p は確認なしでそれを利用します。
  • ChatGPT にサインインした Codex CLI: 使用量はプランの割当てに対してカウントされ、OpenAI の料金ページでは 5 時間ウィンドウごとのローカルメッセージ数で見積もられ、週次リミットも適用される場合があります。割当てを超えるとクレジットで継続できます。Plus と Pro では Codex はトークン数とリミットのパーセンテージを表示し、ドル額は示しません。
  • API キーを使用した Codex CLI: OpenAI Platform アカウントの標準 API 料金で課金されます。

ベンチマークで測定した内容

両エージェントをそれぞれ単独で実行しました(claude -p と codex exec を通常設定で使用し、Claude Code の --bare モードは使用しません)。同一リポジトリに対する 5 つの 1 行質問を対象とし、測定単位は質問ごとのキャッシュ加重入力です。エージェントが回答のために送信したすべてのリクエストを対象とし、新規トークンはフルウェイト、キャッシュ読み取りは 1/10 のウェイトで計算します。各行は 1 つのモデルを表します。

各モデルについて、表はエージェント単独の数値(エージェント比較時に読むべき数値)と、同じモデルで capsul 経由で送った同一質問の数値(ベンチマークが測定したもの)を示します。回答は自動でチェックされ、期待した詳細が含まれた質問の数(5 件中)をカウントします。

モデル通常の入力capsul 使用時の入力通常のコストcapsul 使用時のコスト入力削減量
Claude Haiku 4.555,50019,300$0.0812$0.0265x2.88
Claude Sonnet 554,20018,900$0.153$0.0487x2.86
Claude Sonnet 4.631,40016,600$0.139$0.0613x1.89
Claude Opus 4.645,70016,400$0.332$0.101x2.78
Claude Opus 4.738,70020,100$0.28$0.126x1.92
Claude Opus 4.865,80013,800$0.498$0.0825x4.75
Claude Opus 545,30016,200$0.343$0.101x2.80
Claude Opus 5.542,30015,900$0.222$0.0696x2.66
Claude Fable 541,40017,600$0.633$0.219x2.35
Claude Fable 5.149,70023,400$0.636$0.279x2.12
Claude Code の Claude モデル:1 行のコーディング質問あたりのキャッシュ加重入力トークン数と API 換算コスト。通常のエージェントと capsul を比較。 公開データセットから計算:Claude キャンペーン 2026年9月22日、Codex キャンペーン 2026年9月4日。

Claude の表にはコスト列が追加されています:Claude Code が API 定価で質問ごとにかかるトークン費用を報告したものです。サブスクリプション利用時にはこの金額は支払われません。

モデル通常の入力capsul 使用時の入力入力削減量
gpt-5.6-sol33,10014,700x2.26
gpt-5.6-terra24,00011,100x2.16
gpt-5.6-luna32,10013,600x2.36
gpt-5.547,2008,130x5.81
gpt-5.431,8008,220x3.86
gpt-5.4-mini42,30012,100x3.49
Codex CLI の GPT モデル:1 行のコーディング質問あたりのキャッシュ加重入力トークン数を、通常のエージェントと capsul で比較。Codex が報告するのはトークン数で、ドル額ではありません。 公開データセットから計算:Claude キャンペーン 2026年9月22日、Codex キャンペーン 2026年9月4日。

Codex の表にはコスト列がありません。ChatGPT プランでは Codex がトークン数のみを報告し、ドル額は表示しないためです。この実行はそのプランで行われました。

2 つの表が順位付けではない理由

並べて見ると、2 つの表は最高でも指標程度であり、以下の 5 つの理由があります:

  • 測定日時とコードが異なる。Claude の行は 2026 年 9 月 22 日、主な Codex キャンペーンは 2026 年 9 月 4 日に測定され、各々その時点のエージェントバージョンと capsul コードで実行されています。
  • モデルが異なる。両表に共通するモデルはなく、エージェント間比較は同時にモデル比較でもあります。
  • トークンの計算方法が異なる。各ベンダーは独自のトークン化方式を持ち、Anthropic は新しいモデルが同じテキストを約 30% 多くのトークンとしてカウントすると述べています。トークンは固定長のテキストではありません。
  • 会計方式が異なる。Claude はキャッシュ書き込みを報告し、ベンチマークはそれを新規入力より高く重み付けしています(Anthropic の課金方式に合わせ)。Codex の実行ではキャッシュ書き込みは報告されず、ChatGPT プランのクレジット課金ではキャッシュ書き込みに別途料金はありません。
  • 繰り返し回数が異なる。Claude の各質問は 3 回、Codex の各質問は 2 回実行され、最初の実行がキャッシュを書き込み、以降の実行がそれを読み取ります。

これらの注意点を除いても有用な点は残ります。1 行の質問でも、両エージェントは単独で数万トークン(キャッシュ加重)を送信し、そのほとんどは質問ではなくコンテキストです。また、各表内でモデル間の差は大きく、選択するモデルはエージェント以上に数値を左右します。

この結果をどう活かすか

すでにどちらかのプランを利用している場合、トークン節約のためにエージェントを切り替えることはほとんど効果がありません。効果があるのは両ツールで共通する以下の点です:

  • 各タスクは新しいセッションで開始する。/clear は両エージェントで同様に機能し、古いトランスクリプトの再送信が止まります。
  • 対象ファイルを明示的に指定する。探索層は実行ごとに最も変動しやすいです。
  • 環境層は小さく保つ:短い CLAUDE.md または AGENTS.md、使用しない MCP サーバーやプラグインは除外します。
  • タスクに合わせてモデルと推論コストを設定する:Claude Code では /model と /effort、Codex では /model を使用し、モデルが許容する範囲で設定します。

自分のコードで両エージェントを比較するには、他人の表(自分たちのものも含む)ではなく実際のタスクを測定します。各エージェントで 3 回実行し、同一リポジトリの新しいセッションで行います:最初の実行がキャッシュを書き込み、以降が読み取ります。claude -p と --output-format json を使用して、モデル別の入力、キャッシュ読み取り、キャッシュ書き込み数(サブエージェントを含む)を合計します(単純な usage フィールドは含まれません)。codex exec --json では最終 turn.completed イベントの使用量を読み取り、入力からキャッシュ分を差し引きます。新規入力はフルウェイト、キャッシュ読み取りは 1/10、報告されたキャッシュ書き込みは課金プレミアムで重み付けし、各エージェントのタスクあたりトークンコストを算出できます。

両エージェントを併用する場合、capsul は同一コマンドでどちらかを駆動し、設定したトークン予算内で動作させ、各エージェントの消費をローカルに記録します。

capsul burn

ローカル消費をエージェント、モデル、プロジェクト別に分割して表示します。

よくある質問

Claude Code と Codex CLI のどちらがトークンを少なく使いますか?

どちらも信頼できるほど少なくはありません。使用するモデル、指示や有効化したツール、エージェントの探索量が総トークン数を左右し、ベンダーごとにトークン化方式も異なります。単独で実行したベンチマークでは、1 エージェント内のモデル間の差がエージェント間の差以上に大きかったです。

Codex CLI は Claude Code より安いですか?

サブスクリプションの場合、価格はプランで決まり、違いは 5 時間または週次リミットがどれだけ続くかです。API キー利用時は両方ともベンダーの定価でトークン単位の課金となり、キャッシュ入力は多くのモデルで新規レートの約 1/10 です。いずれにせよ、あなたにとって安価なエージェントは、より小さなモデルと少ないコンテキストでタスクに答えるものです。これは自分のコードで測定しなければ分かりません。

Pro または Max を利用しているのに Claude Code がドルコストを表示するのはなぜですか?

/usage はトークン数を API 定価で換算してセッションのコストを算出します。これは API キーで同じ作業を行った場合の費用です。Anthropic のドキュメントでは、Pro と Max の加入者に対してこの数値は課金に関係ないとしています。プランに対して消費される量は、使用量バーと同じ画面に表示されます。

ChatGPT プランで Codex CLI のトークン使用量を確認するには?

/status と入力すると、使用中・残りのコンテキストウィンドウと 5 時間・週次リミットの残量が表示されます。/usage ではアカウントのトークン活動を日別、週別、総計で確認できます。終了時に Codex はセッションのトークン数を出力し、合計は新規入力と出力を含み、キャッシュ入力は別枠で表示されます。

2 つのエージェントが報告するトークン数を比較できますか?

そのままの出力では比較できません。Claude は入力、キャッシュ読み取り、キャッシュ書き込みを別々に報告しますが、Codex の JSON 出力の input_tokens にはすでに cached_input_tokens が含まれています。両方をキャッシュ加重入力に変換し、新規トークンはフルウェイト、キャッシュ読み取りは 1/10 のウェイトで計算し、同一タスクを複数回実行した結果を比較してください。

$ npm i -g @penra/capsul

← ガイド一覧