Token
Un token est l'unité que lit et que facture un modèle de langage : un mot courant, un fragment de mot ou un signe de ponctuation, soit environ trois à quatre caractères en moyenne.
Les modèles ne lisent ni des caractères ni des mots. Ils lisent des tokens, les morceaux qu'un découpeur taille dans le texte. Les mots fréquents font souvent un token chacun ; les mots rares, les identifiants et les écritures non latines sont taillés en plusieurs. getUserById pèse plus qu'il n'en a l'air, et un paragraphe en japonais pèse plus que le même paragraphe en anglais.
Tout est compté ainsi : votre question, les fichiers envoyés avec elle, la réponse du modèle, et toute la conversation jusqu'ici. C'est ce dernier point qui fait du token l'unité de coût d'une session d'agent plutôt qu'un détail technique. L'historique est renvoyé à chaque tour : un token ajouté tôt est payé plusieurs fois.
Une règle utile pour de la prose : environ 750 mots pour mille tokens. Pour du code source, attendez-vous à pire : les identifiants, la ponctuation et l'indentation coûtent tous.