Tokens d'entrée pondérés par le cache

Les tokens d'entrée pondérés par le cache comptent chaque token selon son prix relatif à une entrée nouvelle : plein tarif pour l'entrée fraîche, tarif réduit pour les lectures et majoration pour les écritures.

Un total brut donne le même poids à tous les tokens d'entrée, mais la facturation les distingue. Sur l'API Anthropic, en septembre 2026, une lecture du cache coûte un dixième de l'entrée fraîche sur la plupart des modèles. Une écriture coûte 1,25 ou 2 fois cette entrée selon sa durée de vie. Deux exécutions de même taille brute peuvent donc avoir des coûts très différents selon leur part mise en cache.

Le comptage brut trompe dans les deux sens. Donner le plein poids aux lectures surestime une session dont le cache fonctionne bien. Ne compter que le champ non mis en cache la sous-estime : dans les rapports Anthropic, input_tokens exclut ce qui a été lu ou écrit dans le cache. Le total est la somme de ce champ, de cache_read_input_tokens et de cache_creation_input_tokens. Toute comparaison entre deux façons de faire une tâche doit préciser la mesure utilisée.

La pondération convertit l'entrée en équivalents de tokens frais : coefficient 1 pour l'entrée ordinaire, 0,1 pour les lectures, et coefficient de facturation pour les écritures. Le résultat suit le coût de l'entrée sans dépendre du tarif d'un modèle. Ces coefficients restent une convention : en septembre 2026, une lecture ne vaut que 0,05 sur Claude Opus 5.5 et 0,025 sur Claude Fable 5.1.

Cette mesure ne couvre que l'entrée. La sortie, y compris les tokens de réflexion, se tarifie séparément. Elle ne représente pas non plus le compteur d'usage d'un abonnement, que le fournisseur calcule selon ses propres règles.

← Tous les termes