Skip to main content
厂商: Anthropic Model ID: claude-opus-4-8 能力: 200K context · tool use · vision · prompt caching · streaming · extended thinking 价格: 按 token,Opus 档(实时价格 Opus 4.8 是当前的 Anthropic 旗舰,也是 Opus 4.7 的 后继。当那一发必须对时你伸手抓的就是它。它比 Sonnet 慢、比 Sonnet 贵,并且在 Sonnet 开始偷工减料的地方明显更稳:长上下文推理、每一步 都依赖上一步的多步计划,以及那种 第一稿 就要能编译并匹配既有代码 库架构约定的代码生成。开 extended thinking 后等待变长,但在难题上的 答案质量提升超过延迟成本所暗示的幅度。

请求

Body 参数

响应

thinking_tokens 按输入 token 价计费(extended thinking 增加延迟但不 增加全额输出成本)。当前价格见 pricing table

代码示例

Extended thinking

设置 thinking 块来开启:
budget_tokens 是内部推理 token 的上限。模型可能用得更少;下限是几 百。推荐预算: 更高预算在难题上单调提升答案质量 —— 但多数任务在 16K 以上边际收益 迅速下降。

Cache control

缓存读取按 pricing table 的折扣价计 费。在 Opus 4.8 上,cache control 是单项杠杆最高的成本优化 —— 大块 system prompt 付一次,每个后续轮次按缓存读取价计费。

错误

何时使用

  • 一发即中的质量重要,并且你愿意等一个深思熟虑的答案。
  • 在既有代码库中、约定重要的代码生成。
  • 每一步都依赖上一步的多步计划(Sonnet 开始漏;Opus 4.8 把链条保持紧)。
  • 200K 窗口内法律 / 医学 / 技术语料的长上下文推理。
  • 中端成本 / 延迟,见 Sonnet 4.6
  • 高吞吐 agent loop,见 Haiku 4.5

限制