Claude Opus、Sonnet 与 Haiku:编码任务的真实成本
每百万 token 的价格只决定编码任务成本的一半。另一半是模型完成任务前花掉多少 token,而价目表不会告诉你这个数字。
编码代理完成一项任务的账单,是两个数字相乘:所选模型的 token 单价,以及它完成任务前使用的 token 数。价目表只给出前者;后者取决于模型的工作方式。
如果一个模型每 token 贵一倍,却只用一半 token 完成,最终成本相同。若模型单价便宜,却多读三个文件,或回答错误而需要重问,总成本反而可能更高。
截至 2026 年 9 月的标价
Anthropic 按每百万 token 为各模型定价,新输入、缓存写入、缓存读取和输出各有价格。下表是截至 2026 年 9 月的 API 标价。
| 模型 | 输入 | 输出 | 缓存读取 | 缓存写入 5 分钟 | 缓存写入 1 小时 | 上下文 |
|---|---|---|---|---|---|---|
| Claude Haiku 4.5 | 1.00 | 5.00 | 0.10 | 1.25 | 2.00 | 200,000 |
| Claude Sonnet 5 | 2.00 | 10.00 | 0.20 | 2.50 | 4.00 | 1,000,000 |
| Claude Sonnet 4.6 | 3.00 | 15.00 | 0.30 | 3.75 | 6.00 | 1,000,000 |
| Claude Opus 4.6 | 5.00 | 25.00 | 0.50 | 6.25 | 10.00 | 1,000,000 |
| Claude Opus 4.7 | 5.00 | 25.00 | 0.50 | 6.25 | 10.00 | 1,000,000 |
| Claude Opus 4.8 | 5.00 | 25.00 | 0.50 | 6.25 | 10.00 | 1,000,000 |
| Claude Opus 5 | 5.00 | 25.00 | 0.50 | 6.25 | 10.00 | 1,000,000 |
| Claude Opus 5.5 | 4.00 | 20.00 | 0.20 | 5.00 | 8.00 | 1,000,000 |
| Claude Fable 5 | 10.00 | 50.00 | 1.00 | 12.50 | 20.00 | 1,000,000 |
| Claude Fable 5.1 | 10.00 | 50.00 | 0.25 | 12.50 | 20.00 | 1,000,000 |
对编码代理来说,表中有三点比醒目的新输入价格更重要:
- 缓存读取。代理每轮重发整段对话,多数内容从提示缓存读取,因此大部分输入 token 按这个价格计费。多数模型的缓存读取是输入价格的十分之一,Fable 5.1 为四十分之一;Opus 5.5 为二十分之一,即每百万 token 0.20 美元,恰好与 Sonnet 5 相同。
- 输出,包括思考。每个模型的输出价格都是输入的五倍,思考 token 也按输出计费。
- Sonnet 5 的价格。每百万输入 2 美元、输出 10 美元起初被称作入门价格;Anthropic 后来将其定为标准价格,原计划在 2026 年 9 月 1 日上调到 3 和 15 美元并未发生。
另一半:每项完成的任务花多少 token
每项任务的 token 用量因模型而异,与单价无关。探索更多的模型在回答前会读更多文件,而每个文件都留在上下文中,后续每轮还要为它付费。错误回答已经花过一次 token,重试还要再花。思考更久的模型会按输出价格消耗更多 token。
Anthropic 的成本指南从另一面说明同一件事:更强的模型往往能以更少工作完成任务,也就是轮数更少、搜索更少、返工更少,这可能抵消较高的 token 单价。在 SWE-bench Pro 的一个子集上,指南报告 Fable 5.1 使用低推理强度时以每解决一题 0.54 美元的成本解决 88.6% 的任务;默认设置的 Sonnet 5 则以 0.84 美元解决 77.4%,尽管前者 token 单价高五倍。指南也展示了排名相反的任务,并指出价目表无法预言具体哪一种更便宜。
逐模型测量的每题成本
下表在真实仓库中同时测量这两半:让各模型通过 Claude Code 回答同一批单行问题,每题重复三次,并采用 Claude Code 自身按 API 标价报告的成本。token 数把缓存读取按新 token 的十分之一计算,这是多数模型的计费比例。表中也列出同一模型通过 capsul 回答相同问题的结果;基准测试页解释测量方法。
| 模型 | 原始输入 | capsul 输入 | 原始成本 | capsul 成本 | 减少的输入 |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | 55,500 | 19,300 | US$0.0812 | US$0.0265 | x2.88 |
| Claude Sonnet 5 | 54,200 | 18,900 | US$0.153 | US$0.0487 | x2.86 |
| Claude Sonnet 4.6 | 31,400 | 16,600 | US$0.139 | US$0.0613 | x1.89 |
| Claude Opus 4.6 | 45,700 | 16,400 | US$0.332 | US$0.101 | x2.78 |
| Claude Opus 4.7 | 38,700 | 20,100 | US$0.28 | US$0.126 | x1.92 |
| Claude Opus 4.8 | 65,800 | 13,800 | US$0.498 | US$0.0825 | x4.75 |
| Claude Opus 5 | 45,300 | 16,200 | US$0.343 | US$0.101 | x2.80 |
| Claude Opus 5.5 | 42,300 | 15,900 | US$0.222 | US$0.0696 | x2.66 |
| Claude Fable 5 | 41,400 | 17,600 | US$0.633 | US$0.219 | x2.35 |
| Claude Fable 5.1 | 49,700 | 23,400 | US$0.636 | US$0.279 | x2.12 |
读表时可按以下顺序:
- 先看 Claude Code 独立运行:每个模型按自身标价花了多少。
- 比较价格相同的行。Opus 4.6、4.7、4.8 和 Opus 5 都是输入 5 美元、输出 25 美元,因此它们的差距来自 token 数,不是单价;写作时差距相当大。Anthropic 在自己的编码基准测试中也报告了类似现象。
- 跨模型代际比较美元金额,而不是 token 数。从 4.7 起,新模型会把同一段文本计为更多 token,见下一节;因此只看 token 数会让 Haiku 4.5、Sonnet 4.6 和 Opus 4.6 显得更有利。
- 把成本和答案检查结果一起读。每题便宜,却找到更少预期答案的行,并不代表每个正确答案便宜。
- 不要假设标价较低就一定获胜。Sonnet 5 的标价低于 Sonnet 4.6,但写作时在 Claude Code 独立运行的这些问题上并非更便宜,因为它花了更多 token。在 Anthropic 的编码基准测试上,降价则胜出,尽管 Sonnet 5 在那里每题也用更多 token。同样两个模型,任务不同,赢家就不同。
Claude 4.7 起,分词器变了
Anthropic 的定价页指出,Claude 4.7 及更新模型采用新的分词器,同一段文本产生的 token 约多 30%,实际增幅取决于内容。在上表测量的模型中,这包括 Opus 4.7、4.8、5 和 5.5、Sonnet 5,以及两个 Fable;Opus 4.6、Sonnet 4.6 和 Haiku 4.5 使用旧分词器。
因此,跨越这条分界线直接比较每 token 数据并不公平。新模型还未开始做事,同一提示就已经计为更多 token。这也是 Anthropic 建议比较每项完成任务成本的原因。
推理强度是第二个调节项
在同一模型内,推理强度决定它花多少 token:思考多久、调用多少工具、写多少内容。级别从 low、medium、high、xhigh 到 max。较低强度通常意味着更少、更简短的工具调用和更少思考;思考按输出价格计费。
以 2026 年 9 月为准,Claude Code 对支持推理强度的模型默认使用 high,但 Opus 5.5 默认为 medium、Opus 4.7 为 xhigh。因此按默认值比较 Sonnet 5 与 Opus 5.5,并不是在相同设置下比较。Haiku 4.5 没有推理强度设置。Opus 5.5 和 Fable 系列始终会思考,不能关闭;调节推理强度是控制其推理量的主要方式。
Anthropic 称,medium 强度的 Sonnet 5 可与 high 强度的 Sonnet 4.6 相比。它还指出,长期编码工作确实能从更高强度中获得准确性;对模型能力范围内的任务,最高强度则可能为任务用不到的深度付费。
/effort medium设置 Claude Code 的推理强度;单独输入 /effort 可打开滑块。
什么任务选什么模型
- Haiku 4.5 适合机械性编辑:重命名、格式化、你会检查的单文件修改、快速查找。它每 token 最便宜,价格是 Sonnet 5 的一半。Anthropic 将其定位于结果可核查的大量工作,而非长时间代理循环。它的窗口是 200,000 token,不是百万;Anthropic 承诺至少提供至 2026 年 10 月 15 日,因此依赖它前应查看弃用页面。
- Sonnet 5 适合日常工作。Anthropic 的 Claude Code 文档称 Sonnet 能很好完成多数编码任务,成本低于 Opus。按 token 计,除了两者相同的缓存读取价格,Sonnet 5 在其他各项上都是 Opus 5.5 的一半。
- Opus 适合难题:大范围重构、困难的调试、架构决定。以 2026 年 9 月为准,Opus 5.5 也是 Claude Code 在 Pro、Max、Team、Enterprise 和 API 中的默认模型;如果从未选过模型,支付的就是它的成本。
- Fable 适合最难、运行时间最长的任务。它的 token 单价最高,但 Anthropic 成本指南建议从低推理强度的 Fable 5.1 开始代理任务,在失败处再提高。取决于套餐和席位级别,Claude Code 可能从用量积分而非套餐所含额度中扣除 Fable 用量;
/model选择器的 Fable 行会说明。
在 Claude Code 中切换模型
会话中,/model 加模型别名会立即切换;单独输入 /model 可打开选择器,左右方向键还能设置推理强度。启动时可用 claude --model;设置文件中的 model 字段或 ANTHROPIC_MODEL 环境变量则可保存选择。主要别名是 haiku、sonnet、opus、fable,还有 opusplan:规划时用 Opus,执行时用 Sonnet。
/model sonnet将当前会话切换到最新 Sonnet。
claude --model haiku用 Haiku 开始新会话。
应在任务开始时切换,不要进行到一半才换。每个模型有独立的提示缓存;切换后的下一次请求没有缓存命中,需要重读整段对话,长会话中尤其贵。缓存仍有效时,Claude Code 会要求确认切换。opusplan 每次切换规划模式都相当于换模型;多数模型在会话中途调整推理强度,也会付出同样的重读成本。对子代理的简单工作,Anthropic 建议在配置中设 model: haiku。
如果想减少每个问题携带的内容,而不是只降低 token 单价,capsul 使用相同的模型名称,并向模型发送问题所需的简短片段。上表中的 capsul 列就是对这种方式的测量。
capsul ask 'rename userId to accountId in the auth module' --model haiku驱动你已登录的 Claude CLI,并使用你指定的模型。
常见问题
Claude Code 使用 Opus 值得吗?
难题往往值得:更强的模型可能以更少轮次、更少搜索和返工完成任务,抵消较高的 token 单价。常规编辑则容易为用不到的能力付费;Anthropic 文档也指出,API 费用意外偏高通常与从未清空的会话,或把 Opus 留作默认模型有关。以 2026 年 9 月为准,Opus 5.5 是 Claude Code 在 Pro、Max、Team、Enterprise 和 API 中的默认模型,想确认是否在用更便宜的模型,应先查看 /model。
编码最便宜的 Claude 模型是哪一个?
按 token 单价,2026 年 9 月 Anthropic API 中最便宜的是 Claude Haiku 4.5:每百万输入 token 1 美元,输出 5 美元。按任务计则取决于模型用了多少 token、答案是否正确,因为错误答案会带来重试成本。Anthropic 认为 Haiku 适合结果可检查的大量工作,而非长代理循环,因此它适合机械性编辑,但不一定适合所有任务。
Claude Sonnet 5 比 Opus 5.5 便宜吗?
以 2026 年 9 月为准,按 token 计,Sonnet 5 的新输入、缓存写入和输出价格都是 Opus 5.5 的一半;缓存读取则相同,均为每百万 token 0.20 美元。Anthropic 指出,缓存输入是代理账单的主要部分,所以实际单价差距小于醒目的标价所暗示的。每任务谁更便宜还取决于各自使用的 token 数:日常编码通常 Sonnet 5 有利,难题上更快完成的模型可能缩小差距。
相同提示为何在较新的 Claude 模型上用更多 token?
Claude 4.7 及更新模型使用新分词器。Anthropic 称,同一段文本产生的 token 约多 30%,确切增幅取决于内容。Opus 4.6、Sonnet 4.6 和 Haiku 4.5 使用旧分词器。因此应比较每项任务的成本,而不是 token 个数;新模型还没开始工作,计数就可能显得更高。
推理强度会改变任务成本吗?
会。它影响模型思考多久、调用多少工具、写多少内容,而思考按输出价格计费,因此较低强度通常在相同任务上花更少 token。Claude Code 中可用 /effort 或 /model 选择器的方向键设置。以 2026 年 9 月为准,多数模型默认 high,Opus 5.5 默认 medium,Haiku 4.5 没有此设置。Anthropic 帮助中心也把推理强度和模型列为影响订阅用量的因素。
$ npm i -g @penra/capsul