Durée de vie du cache (TTL)
Le TTL d'un cache est la durée pendant laquelle un préfixe de prompt conservé reste disponible sans être utilisé, avant de devoir être retraité et réécrit.
Sur l'API Anthropic, la durée par défaut est de cinq minutes. En septembre 2026, une durée d'une heure porte le prix d'écriture à deux fois celui de l'entrée ordinaire, contre 1,25 fois pour cinq minutes. Ce n'est pas une date d'expiration fixe : chaque lecture du préfixe relance le minuteur gratuitement. Le cache reste donc actif tant que les requêtes arrivent assez vite. Le décompte commence au début de la requête, pas à la fin de la réponse, qui peut en consommer une partie.
Choisir une durée revient à parier sur les pauses. Avec une heure, la première requête après vingt minutes d'arrêt relit le préfixe au lieu de le reconstruire. Dans une série de requêtes séparées de moins de cinq minutes, cette option ne fait qu'augmenter le prix des écritures.
Les agents de code choisissent souvent pour vous. En septembre 2026, Claude Code demande une heure pour la conversation principale sur un abonnement Claude encore dans son usage inclus. Il demande cinq minutes avec une clé API, un fournisseur cloud ou des crédits d'usage. Les sous-agents reçoivent cinq minutes par défaut. Le réglage promptCacheTtl permet de modifier ce choix pour la conversation principale.
Quelle que soit la durée, le premier message après expiration est le plus coûteux : le cache manque et l'agent retraite tout le contexte. Une lecture coûtant un dixième du prix d'entrée sur la plupart des modèles et une écriture au moins 1,25 fois ce prix, reconstruire une fois un grand préfixe coûte plus que de le relire dix fois.