トークナイザー

トークナイザーはテキストをモデルが読み取り課金対象とするトークンに分割するコンポーネントで、同一テキストでもモデルによりトークン数が異なる理由です。

最新のトークナイザーはデータから構築され、頻出シーケンス(一般的な単語や慣れたコードパターン)は単一トークンに、稀な識別子や特殊な書式、多くの非ラテン文字は複数に分割されます。語彙はモデル学習時に固定されるため、トークン数は測定対象のモデルと併せて意味を持ちます。

トークナイザーは世代間で変化します。Anthropic によれば、2026年9月時点で Claude 4.7 以降のモデルは新しいトークナイザーを使用し、Claude Sonnet 4.6 以前と比べ同一テキストで約30%多くトークン化します(増加率は内容次第)。Claude Opus 4.6 と Opus 4.7 はトークン単価が同じため、トークナイザーだけで新モデルのプロンプトコストが上がります。

これに伴う三つの結果があります。あるモデルで測定したトークン数は他モデルに転用できないため、予算・コンテキストウィンドウ見積もり・コスト予測は切り替え後に再計算が必要です。トークン単価はトークンがカバーするテキスト量を考慮せずに比較できません。また、1トークンあたり4文字という経験則は英語散文の平均であり、コードのカウントには適しません。

正確なトークン数はプロバイダーから取得します。Anthropic のトークンカウントエンドポイントは指定モデルのトークナイザーでリクエストの入力トークン数を返し、無料ですがレート制限があります。ドキュメントでは結果は見積もりであり、実際の請求と若干差異する可能性があると説明しています。

← 用語一覧