拡張思考

拡張思考は、モデルが回答前にトークンとして生成する推論で、表示有無に関わらず出力トークンとして課金されます。

モデルはまず問題を解き、再表現・アプローチ検討・中間結果確認を行い、最後に回答を書き出します。この下書き作業が難しいタスクでの成果につながりますが、コストでもあり、すべての思考トークンは出力として生成され、出力レートで課金され max_tokens にカウントされます。Claude Code のドキュメント(2026年9月時点)では、モデルによりリクエストあたり数万トークンに達する可能性があると警告しています。

見えるものは支払額と一致しません。最新の Claude モデルでは思考が要約として返されるか全く返らないことがありますが、課金はモデルが生成した全推論を対象とするため、可視テキストは実際の費用を過小評価します。使用レポートの output_tokens_details.thinking_tokens に実際の数値が示されます。

思考は入力としても戻ります。Anthropic が keep-all モデルと呼ぶもの(2026年9月時点で Claude Opus 4.5 以降、Sonnet 4.6 以降、Fable 系列)では、過去のターンの思考ブロックが会話に残り、以降のリクエストで入力として課金され、履歴全体と同様に扱われます。

深さは固定予算ではなく努力レベルで決まります。Anthropic の API では固定予算モード budget_tokens が 4.6 系列で非推奨となり、4.7 以降は適応的思考に置き換えられ、Claude Fable 5、Fable 5.1、Opus 5.5 では思考を完全にオフにできません。low から max の努力レベルが深さを決定し、Opus 5.5 のデフォルトは medium です。Claude Code では /effort または /model で設定し、セッション途中で変更すると多くのモデルでプロンプトキャッシュが無効化されます。

← 用語一覧