缓存加权输入 token
缓存加权输入 token 按相对于普通输入的价格折算每种输入:普通输入全额计,缓存读取折价计,缓存写入按溢价计。
原始 token 计数把所有输入视为等价,账单却不是如此。截至 2026 年 9 月,Anthropic API 多数模型读取缓存的价格为普通输入的十分之一;写入缓存则因寿命不同,按 1.25 倍或 2 倍计费。因此,两次原始输入量完全相同的运行,仅因缓存比例不同,费用就可能相差数倍。
原始计数可能从两个方向误导。把缓存读取按全额计算,会高估缓存效果好的会话;只统计未缓存字段,则会低估总量。在 Anthropic 的用量报告中,input_tokens 只包含既未从缓存读取、也未写入缓存的部分。总输入还要加上 cache_read_input_tokens 和 cache_creation_input_tokens。比较两种工作方式时,必须说清所用口径。
加权把输入折算成普通输入的等价量:普通输入乘 1,缓存读取乘 0.1,缓存写入乘对应的写入系数。这个数字反映输入成本,又不绑定某个模型的每 token 标价。固定权重是一种比较约定,不等于所有模型的价格表:截至 2026 年 9 月,Claude Opus 5.5 的缓存读取系数为 0.05,Claude Fable 5.1 为 0.025。
它只衡量输入。输出及其中的思考 token 单独定价,不在此指标内。它也不是订阅套餐的用量计量器,服务商会用自己的方法计算套餐消耗。