扩展思考

扩展思考是模型在作答前生成的推理 token,无论用户能否看到推理内容,都会按输出 token 计费。

模型可能先重述问题、尝试方案并检查中间结果,然后才写出答案。这样的推理有助于处理困难任务,也带来成本:每个思考 token 都属于生成的输出,按输出价格计费,并计入 max_tokens。截至 2026 年 9 月,Claude Code 文档提醒,默认设置下单次请求可能产生数万思考 token,具体取决于模型。

可见内容不等于计费用量。较新的 Claude 模型可能只返回思考摘要,甚至完全不显示,但计费仍涵盖模型生成的完整推理。用量报告中的 output_tokens_details.thinking_tokens 可以查看实际数值。

思考还可能在后续轮次作为输入返回。在 Anthropic 所称的保留全部思考的模型上,截至 2026 年 9 月包括 Claude Opus 4.5 及之后的 Opus、Sonnet 4.6 及之后的 Sonnet,以及 Fable 系列,先前轮次的思考块会留在对话历史中,并像其他历史一样在后续请求中计入输入。

深度现在主要由努力级别控制,而非固定 token 预算。在 Anthropic API 中,固定预算模式 budget_tokens 于 4.6 模型上已弃用,4.7 起被拒绝,改用自适应思考。Claude Fable 5、Fable 5.1 与 Opus 5.5 无法完全关闭思考;从 low 到 max 的努力级别决定深度,Opus 5.5 默认 medium。Claude Code 可通过 /effort 或 /model 设置;会话中途更改在多数模型上会使提示缓存失效。

← 全部术语