Mise en cache des prompts
La mise en cache des prompts permet à un fournisseur de réutiliser la forme déjà traitée d'un préfixe répété d'une requête à l'autre, en facturant ces tokens une fraction du tarif frais.
Les sessions d'agent se répètent énormément : mêmes instructions système, mêmes définitions d'outils, même début de fil, à chaque tour. Le cache signifie que la tête inchangée de tout cela n'est ni retraitée ni facturée plein tarif.
Le piège, c'est qu'un cache fonctionne par préfixe. Changez quelque chose au début de la séquence et tout ce qui suit redevient frais. C'est pourquoi l'ordre dans lequel le contexte est assemblé a une conséquence de coût invisible dans un comptage brut.
Cela veut aussi dire que comptage brut et comptage pondéré peuvent raconter deux histoires opposées. Un changement qui abaisse l'entrée brute tout en cassant le cache peut faire monter la facture. Une comparaison qui ne dit pas laquelle elle mesure n'est pas une comparaison.