缓存写入
缓存写入是处理并保存提示前缀以供后续复用的操作,其价格高于普通输入,换取之后更便宜的缓存读取。
缓存先在写入时付费。截至 2026 年 9 月,在 Anthropic API 中,默认五分钟寿命的前缀写入价格是基础输入价格的 1.25 倍,一小时寿命为 2 倍;多数模型读取缓存的价格则为基础价的十分之一。响应会以 cache_creation_input_tokens 单独报告写入量。
是否划算取决于后续读取次数。按 Anthropic 的价格,五分钟写入被读取一次便能回本,一小时写入需读取两次。写入后从未读取的前缀比直接作为普通输入更贵。太短的前缀也不会被缓存;截至 2026 年 9 月,最低长度因模型而异,从 512 到 4,096 token。
代理会话中的写入通常发生在首个请求,以及每轮新增的内容被保存、供下一轮读取时。模型切换、工具列表变化、系统提示词修改,或停顿超过缓存寿命,都可能破坏前缀,使较大范围的上下文重新写入。
因此,持续运作的会话通常应有远多于写入的读取量。如果 cache_creation_input_tokens 每轮都居高不下,可能是请求靠前的位置持续变化,导致每一轮都支付写入溢价,却很少享受读取折扣。