单项任务成本
单项任务成本是从开始到完成一项工作所花的总费用,包含所有请求、重试和委派调用。
价格表按 token 报价,实际要完成的却是整项工作。代理可能需要探索、编辑、运行测试和修正错误,才能交付一个结果。请求次数会随模型和投入的推理程度变化。因此,每 token 最便宜的模型不一定能以最低总成本完成任务。截至 2026 年 9 月,Anthropic 的成本指南也建议按完成任务的成本比较模型,因为能力更强的模型有时能减少轮次、搜索和返工。
失败尝试必须算进去。失败请求的 token 仍会计费,重试也一样。若较便宜的模型更常失败,每次请求省下的钱可能被重试抵消。之后另开会话纠正有问题的答案,同样属于原任务的成本。
分词器不同,token 数也不再能直接比较。Anthropic 指出,对同样的文本,其 4.7 及之后的模型相较早期模型大约会产生多 30% 的 token,具体幅度取决于内容。直接比较用量会让新模型显得更费 token;只比较每 token 单价,又忽略每个 token 覆盖的文本变少。完成任务的美元成本能避开这两种偏差。
测量时需先明确任务及成功标准,然后计入主会话、子代理、思考 token 和重试的全部费用。若实际使用的是不按 token 逐项收费的订阅套餐,通常以 API 等价成本表示这个总量。