Réflexion approfondie
La réflexion approfondie est le raisonnement qu'un modèle génère avant sa réponse, facturé comme des tokens de sortie même lorsque ce raisonnement n'est pas visible.
Le modèle examine d'abord le problème, essaie des pistes et vérifie des étapes intermédiaires, puis rédige sa réponse. Ce travail préparatoire peut améliorer les tâches difficiles, mais chaque token de réflexion est une sortie générée : il est facturé au tarif de sortie et compte dans max_tokens. En septembre 2026, la documentation de Claude Code prévient que le réglage par défaut peut atteindre des dizaines de milliers de tokens par requête selon le modèle.
Le texte affiché n'est pas le compte facturé. Sur les modèles Claude récents, la réflexion revient sous forme de résumé, ou pas du tout. La facturation couvre néanmoins tout le raisonnement généré. Le rapport d'usage donne le chiffre effectif dans output_tokens_details.thinking_tokens.
La réflexion peut aussi revenir comme entrée. Sur les modèles qu'Anthropic appelle keep-all, dont Claude Opus 4.5 et suivants, Sonnet 4.6 et suivants ainsi que Fable en septembre 2026, les blocs de réflexion des tours antérieurs restent dans la conversation. Ils sont alors facturés comme entrée aux requêtes suivantes, avec le reste de l'historique.
La profondeur se règle désormais par l'effort plutôt que par un budget fixe. Sur l'API Anthropic, budget_tokens est obsolète sur les modèles 4.6 et refusé à partir de 4.7, au profit de la réflexion adaptative. Sur Fable 5, Fable 5.1 et Opus 5.5, on ne peut pas désactiver la réflexion : l'effort de low à max en règle l'ampleur, avec medium par défaut sur Opus 5.5. Dans Claude Code, /effort ou /model le change. Sur la plupart des modèles, le modifier pendant la session invalide le cache.