Razonamiento ampliado

El razonamiento ampliado son los tokens que un modelo genera para razonar antes de responder y que se facturan como salida aunque no se muestren al usuario.

El modelo analiza el problema, prueba enfoques y comprueba resultados intermedios antes de redactar. Ese trabajo puede mejorar tareas difíciles, pero cada token generado se cobra a tarifa de salida y cuenta contra max_tokens. A septiembre de 2026, la documentación de Claude Code advierte que el valor por defecto puede llegar a decenas de miles de tokens por petición según el modelo.

Lo visible no es lo facturado. En modelos Claude recientes el razonamiento puede mostrarse resumido o no mostrarse, pero se cobra el total generado. El informe de uso da la cifra en output_tokens_details.thinking_tokens.

El razonamiento anterior también puede volver como entrada. En los modelos que Anthropic llama keep-all, incluidos a septiembre de 2026 Opus 4.5 y posteriores, Sonnet 4.6 y posteriores y Fable, los bloques de razonamiento de turnos previos quedan en la conversación y se cobran como entrada en peticiones futuras.

Ahora se controla la profundidad mediante el esfuerzo. En la API de Anthropic, budget_tokens está obsoleto para los modelos 4.6 y no se acepta desde 4.7. Fable 5, Fable 5.1 y Opus 5.5 razonan siempre; el nivel entre low y max determina cuánto. En Claude Code se ajusta con /effort o /model, y cambiarlo durante la sesión invalida la caché en la mayoría de modelos.

← Todos los términos