Tokens d'entrée et de sortie

Les tokens d'entrée sont tout ce qui est envoyé au modèle lors d'une requête ; les tokens de sortie sont ce qu'il écrit en retour, et dans le travail d'agent l'entrée domine la facture d'un ordre de grandeur ou plus.

L'asymétrie est tout le sujet. Une réponse fait de quelques centaines à quelques milliers de tokens. Le contexte qui l'a produite en fait couramment des dizaines de milliers, et contrairement à la réponse il est renvoyé au tour suivant, puis au suivant.

C'est pourquoi le conseil de demander au modèle des réponses plus brèves n'a presque aucun effet sur le coût, et pourquoi le conseil sur ce qu'on envoie en a un grand.

L'entrée est aussi tarifée différemment selon qu'elle est fraîche ou en cache. L'entrée en cache est facturée une fraction du tarif frais, ce qui veut dire que deux sessions au comptage brut identique peuvent coûter très différemment. Toute comparaison honnête doit dire laquelle des deux elle mesure.

Tous les termes