Écriture en cache

Une écriture en cache traite et conserve le préfixe d'un prompt pour le réutiliser, à un prix supérieur à l'entrée ordinaire en échange de lectures ultérieures moins chères.

Le cache se paie à l'entrée. Sur l'API Anthropic, en septembre 2026, écrire un préfixe coûte 1,25 fois le tarif de base de l'entrée avec une durée de vie de cinq minutes, et deux fois avec une heure. Le relire coûte un dixième du tarif de base sur la plupart des modèles. Le rapport d'usage isole la partie écrite dans cache_creation_input_tokens.

Le calcul montre quand l'opération devient rentable. Selon les prix d'Anthropic, une lecture suffit à rentabiliser une écriture de cinq minutes, deux lectures pour une écriture d'une heure. Un préfixe écrit puis jamais relu coûte davantage qu'une entrée sans cache. Un préfixe inférieur au minimum du modèle, entre 512 et 4 096 tokens en septembre 2026, n'est pas mis en cache.

Dans une session d'agent, des écritures se produisent au premier appel puis sur les nouveaux éléments de chaque tour, que le suivant pourra relire. Elles touchent de nouveau tout le contexte quand le préfixe change : changement de modèle, liste d'outils modifiée, prompt système retouché ou pause plus longue que la durée de vie du cache.

Une session efficace lit donc bien plus qu'elle n'écrit. Si cache_creation_input_tokens reste élevé tour après tour, quelque chose change sans cesse au début de la requête. Chaque tour paie alors la majoration d'écriture sans profiter du tarif de lecture.

← Tous les termes