Escritura en caché

Una escritura en caché procesa y guarda el prefijo de un prompt para reutilizarlo después, con un coste inicial superior al de la entrada normal a cambio de lecturas posteriores más baratas.

La caché se paga al escribir. En la API de Anthropic, a septiembre de 2026, guardar un prefijo durante cinco minutos cuesta 1,25 veces la entrada normal y guardarlo una hora cuesta el doble. Leerlo cuesta una décima parte en la mayoría de modelos. Las respuestas separan la parte escrita como cache_creation_input_tokens.

La rentabilidad depende de las lecturas: una basta para amortizar una escritura de cinco minutos y se necesitan dos para una de una hora. Un prefijo que nunca se vuelve a leer sale más caro que enviarlo sin caché. Los prefijos menores que el mínimo del modelo, entre 512 y 4.096 tokens a septiembre de 2026, no se guardan.

En una sesión de agente se escribe al principio y cuando se añaden nuevos turnos. También hay que volver a escribir el contexto tras cambiar de modelo, alterar las herramientas, editar el prompt de sistema o superar la duración de la caché.

Una sesión estable lee mucho más de lo que escribe. Si cache_creation_input_tokens sigue alto en cada turno, algo temprano en la petición cambia continuamente y se paga el recargo sin aprovechar las lecturas baratas.

← Todos los términos