研究预览阶段——价格可能随时调整
本文的快速模式费率与速度口径于 undefined 取自 Anthropic 官方定价页和快速模式文档;本站模型价格库中这两款模型的标准费率上次核对时间是 undefined。Anthropic 把快速模式标注为需要申请的研究预览,所以下面的表格只代表当前状态,不是长期承诺。
Claude Opus 5 参数与全部 API 费率研究预览 · Claude Opus 5 与 Opus 4.8
Claude 快速模式定价
快速模式是用钱换延迟:在 Claude Opus 5 与 Claude Opus 4.8 上按更高单价计费,换取 Anthropic 公布的最高 2.5 倍输出 token 速率。下面是官方费率与速度口径、它与提示缓存、长上下文、Batch API 的叠加方式,以及判断值不值得的成本测算。
一句话结论
Anthropic 把 Claude 快速模式定价为每百万 token 输入 $10、输出 $50,适用于 Claude Opus 5 与 Claude Opus 4.8。它仍是研究预览,且开通需要申请:有客户经理的直接联系对方,没有的加入 waitlist 排队。可用范围官方只写了一处:Claude API(含 Claude Managed Agents),别的入口一律不在列。提速口径也公布了:输出 token 每秒最高提升到 2.5 倍,作用在 OTPS 而非首 token 时间(TTFT),智能与能力不变。快速费率覆盖完整上下文窗口,输入超过 200K token 也不加价;提示缓存与数据驻留系数叠加在它之上。
什么是 Claude 快速模式?
快速模式是逐请求打开的计费选项,不是另一个模型:在你原本调用的请求里设置 speed: "fast",并带上 fast-mode-2026-02-01 beta header。模型不变,变的只有单价和推理配置。
需要申请的研究预览,按 token 计费
Anthropic 定价页对快速模式的描述是:为 Claude Opus 5 与 Claude Opus 4.8 提供显著更快的输出,并按溢价计费;快速模式文档同时把它标为研究预览,开通方式是向客户经理申请,没有客户经理就进 waitlist。它是独立的一行价格,改变的是你每百万 token 的花费,而不是由哪个模型来回答。
输出 token 速率最高提升到 2.5 倍
Anthropic 快速模式文档写明:Claude Opus 5 与 Claude Opus 4.8 可交付最高 2.5 倍的输出 token 每秒(OTPS),并且提速聚焦在输出速率,不是首 token 时间(TTFT)——长提示该等多久才开始还是等多久。同一份文档也说清了不变的部分:快速模式跑的是同一个模型,只换成更快的推理配置,「智能与能力不变」。请把 2.5 倍看成上限而不是 SLA:官方没有公布延迟分位,也没有典型场景数值,切流量前请先用自己的真实负载把两种模式各测一遍。
适合谁用
有人在等结果的交互场景:聊天界面、IDE 与智能体循环、代码补全、请求链路上的信息抽取。后台任务不适合——那正是 Batch API 的用途,而 Anthropic 明确快速模式不能与 Batch API 同用。另外预览期按账号开通,动手设计之前先确认你的账号拿得到权限。
Claude 快速模式每百万 token 价格
标准费率取自本站模型价格库;快速模式一列是 Anthropic 为预览阶段公布的费率。最后一列是我们自己的除法结果,不是官方表述。
| 模型 | 标准费率(输入 / 输出,每百万 token) | 快速模式费率(输入 / 输出,每百万 token) | 相对标准的倍数(输入 / 输出) |
|---|---|---|---|
| Claude Opus 5 | $5.00 / $25.00 | $10.00 / $50.00 | 2x / 2x |
| Claude Opus 4.8 | $5.00 / $25.00 | $10.00 / $50.00 | 2x / 2x |
| Claude Opus 4.7 | 本站价格库未收录 | 返回错误,且不会回退到标准速度 | — |
| Claude Opus 4.6 | 本站价格库未收录 | 标准速度、标准费率,响应为 usage.speed: "standard" | — |
两款受支持的模型共用同一行快速模式费率;相对各自标准价的倍数放在最后一列,由价格库算得。Opus 4.7 是另一种情况:带 speed: "fast" 的请求会返回错误,并且与 Opus 4.6 不同,不会回退到标准速度——模型本身仍可按标准速度调用。Opus 4.6 则完全不报错:请求按标准速度运行、按标准费率计费,响应里会写 usage.speed: "standard"。两款旧模型,Anthropic 给的解决办法都是迁移到 Claude Opus 5 或 Claude Opus 4.8 后继续用快速模式。表中这两款的标准价仍然留空:Anthropic 在同一个定价页公布了 $5 输入 / $25 输出(每百万 token),但本站价格库没有 Opus 4.7 与 Opus 4.6 的行,而这张表只写能从价格库复算出来的数字。
快速模式如何与缓存、长上下文、Batch 叠加
快速模式替换的是每 token 单价,其它计费系数继续叠加在它之上。规则由 Anthropic 公布,下面这些合算出来的数字出自我们的计算。
提示缓存在快速模式上继续打折
缓存价格历来按输入单价的系数公布,而 Anthropic 明确说明提示缓存系数叠加在快速模式计费之上。也就是说,缓存读取是在快速模式输入价的基础上打折,而不是标准价——缓存写入同理。
Anthropic 不收取长上下文加价
这一行由定价页上的两句话决定。其一,快速模式计费适用于完整上下文窗口,包括输入超过 200k token 的请求,提示词再长,快速费率也不会往上跳。其二,Claude 4.6 及之后的模型按标准价格提供完整上下文窗口——900k token 的请求与 9k token 的请求每 token 单价相同,缓存与 Batch 折扣同样覆盖整个窗口。这在同档位里是实打实的差别:我们价格库里记录的对手方案中,xAI 从 prompt 达到 200K token 起把 Grok 4.7 的输入输出价同时翻倍,OpenAI 与 Sakana 在超过 272K 后按 2 倍输入 / 1.5 倍输出计费(GPT-6 Astra、Fugu Ultra v2)。4.6 之前的模型是否另有长上下文档位,Anthropic 没说,这条结论也就不往那边推。
不能与 Batch API 同时使用
两者互斥。Batch API 低于标准费率、天生慢;快速模式高于标准费率、追求快。任务等得起,折扣就在选择的另一头。
数据驻留系数同样叠加其上
这次 Anthropic 给了数字:区域与多区域端点相对全球端点溢价 10%,而 Anthropic 官方 Claude API 默认就是全球端点。同一页面说明数据驻留系数叠加在快速模式计费之上,所以这 10% 加在快速费率上,不是标准费率上。官方把这档结构的适用范围写成 Claude Sonnet 4.5、Haiku 4.5、Opus 4.5 及其后的所有模型,两款快速模式模型都在其中。
| 计费系数(以 Claude Opus 5 为例) | 标准费率(价格库) | 快速模式下(推算值) |
|---|---|---|
| 缓存读取 / 刷新 | $0.50 | $1.00 |
| 5 分钟缓存写入 | $6.25 | $12.50 |
| 1 小时缓存写入 | $10.00 | $20.00 |
| Batch API(输入 / 输出) | $2.50 / $12.50 | 快速模式下不可用 |
| 输入超过 200K token 的请求 | $5.00 / $25.00 覆盖完整上下文窗口 | $10.00 / $50.00 覆盖完整上下文窗口 |
| 数据驻留系数 | 较全球端点 +10% | 系数叠加在快速费率之上 |
「快速模式下」这一列是推算而非公布:我们从 Opus 5 的价格库行读出各系数的比例(缓存读取除以基础输入价、缓存写入除以基础输入价;价格库现已收录 1 小时缓存写入价,于是这一行也一并推算),再乘到快速模式的输入单价上,依据是 Anthropic 明确说缓存与驻留系数叠加在快速模式之上。Anthropic 没有印出这些合并数字,请把它们当预算估算,最终以账单为准。「输入超过 200K」那一行是例外:两侧都是公布价,谁都不随上下文加价;数据驻留那一格写的是 Anthropic 公布的端点 10% 溢价,不是算出来的金额。
Claude 快速模式在哪些地方可用
能不能用上,取决于四件事:官方点名支持的入口、明确排除的入口、只字未提的入口,以及预览的开通方式。
仅限 Claude API,含 Claude Managed Agents
Anthropic 把范围写得很直接:快速模式以研究预览形式提供,仅限 Claude API,包含 Claude Managed Agents。Managed Agents 属于同一个官方入口,所以快速费率由 Anthropic 自家 API 定义并由它提供;经由其他厂商控制台发起的请求都不在其中。
Bedrock、AWS、Google Cloud、Foundry 都没有
快速模式文档点名了不支持的位置:Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry 均不可用。定价页用另一种说法重复了同一条规则——仅限 Anthropic 官方 Claude API,伙伴运营的云平台不在内。如果你的合同通过这些入口调用 Claude,就按标准速度和标准价格规划;Anthropic 把它们列为「不可用」的地方,而不是「稍后开放」。
Claude 客户端不在公布的可用清单里
Anthropic 公布的清单只覆盖 Claude API 与 Claude Managed Agents,完全没有提到 Claude 客户端——免费版、Pro、Max 都没提。这是文档缺位,不是明确的否定,所以本页把客户端记为「在公布范围之外」,而不是「确认不提供」。同样还没确认的是:客户端里是否存在这个开关、会怎样消耗套餐额度——我们核对的页面里没有任何相关描述。
需要申请的研究预览
开通不是自助的:Anthropic 的要求是向你的客户经理申请快速模式,没有客户经理就加入 waitlist 排队。预览没有公布结束时间,运行期间费率、支持的模型清单、可用平台都可能变化。据此做预算之前,请重新核对官方定价页与快速模式文档。
放回产品线看,这笔溢价买到了什么
同样的每 token 单价,跟不同模型对比会得出不同结论。下面全部是价格库中的每百万 token 费率。
| 模型与模式 | 输入 / 百万 token | 输出 / 百万 token |
|---|---|---|
| Claude Opus 5 — 快速模式 | $10.00 | $50.00 |
| Claude Fable 5.1 — 标准费率 | $10.00 | $50.00 |
| Claude Opus 5 — 标准费率 | $5.00 | $25.00 |
| Claude Sonnet 5 — 标准费率 | $2.00 | $10.00 |
| Claude Haiku 4.5 — 标准费率 | $1.00 | $5.00 |
按 token 计价时,Opus 5 的快速模式与 Claude Fable 5.1 的标准费率落在同一档输入输出价格上:每百万 token 花的钱一样,模型不同。这才是买速度之前该做的对比——用同样的账单,本来能跑哪个模型,它对你的任务是不是更好的答案。
Claude 快速模式的溢价值不值?
它是账单上一个直接的倍数,所以这个问题有算术答案:每一次请求省下的等待时间值多少钱?
测算负载:每月 500 次请求,每次输入 10K、输出 1K token,按 Claude Opus 5 计价,且没有任何缓存命中。
- 标准费率
- $37.50
- 快速模式费率
- $75.00
- 每月多出
- +$37.50
- 每次请求多出
- +$0.075
判断标准
当有人在等结果、而单次请求的额外成本明显小于它省下的时间时,这个溢价值得付。没人在看时钟时就不要付:把任务用折扣价批量跑、把提示词压缩,或者只把用户真正能感知的那几步留给快速模式,其余负载换到更便宜的模型上。
上面的示例把每个输入 token 都按未命中缓存计价,因此一旦有可复用的前缀,总额就会变——缓存是在快速模式费率上打折,而不是把费用取消。速度那一侧依旧只有上限、没有承诺:官方公布的是最高 2.5 倍输出 token 每秒,没有延迟分位,也没有典型值,更不能拿来当你这条请求的保证。所以本页能精确算出溢价,时间那一侧只能给出方向。
本文的数字要么于 2026-09-22 取自 Anthropic 官方定价页与快速模式文档,要么由本站模型价格库计算得出——价格库里 Anthropic 的费率上次核对是 2026-09-22。这一轮之后仍未确认的有:Claude 客户端是否提供快速模式、零数据保留(ZDR)在该功能下的计费条款、预览何时结束、4.6 之前的 Claude 模型是否另有长上下文档位,以及 2.5 倍输出速度背后任何延迟分位数据。这些格子仍标注未确认,而不是猜一个数。