价格已于 2026 年 9 月 14 日对照 Anthropic 官方文档复核

0.025 倍缓存读取价写在 Fable 5.1 的官方费率行里(与 Mythos 5.1 同等待遇),不是限时促销;其余 Claude 模型维持 0.1 倍。

查看完整实时价格表

Claude Fable 5.1 提示词缓存 · 2026年9月

Claude Fable 5.1 提示词缓存:$0.25 读取价怎么算

Fable 5.1 的缓存读取价是每百万 tokens $0.25,相当于基础输入价的 0.025 倍——其他所有 Claude 模型仍是 0.1 倍。这篇把写入费、TTL 和真实会话成本一次说清。

一分钟结论

Anthropic 定价文档(2026-09-14 核对)把 Claude Fable 5.1 的缓存读取定为 $0.25/百万 tokens,比 Fable 5 的 $1.00 降了 75%。缓存写入价格不变:5 分钟 $12.50/百万、1 小时 $20/百万。一个 20 轮、5 万 tokens 固定前缀的代理会话,缓存读取一共只花约 $0.24。DeepSeek V4.1 Flash 的 cache hit 更低(闲时 $0.003),但那是另一个价位的模型。

Fable 5.1 缓存费率表

全部按每百万 tokens 计价(美元),倍率以基础输入价 $10 为基准。

计费项单价(USD / 百万 tokens)相对输入价倍率
输入(未命中缓存)$10.001x
缓存写入 · 5 分钟 TTL$12.501.25x
缓存写入 · 1 小时 TTL$20.002x
缓存读取(命中)/ 刷新$0.250.025x

Batch API 的 5 折优惠与缓存倍率可以叠加;1M 上下文全程同一价格,没有长文加价。

降了 75% 的那一行

Fable 5.1 发布时真正改变代理成本结构的是缓存读取价。

  • 读取从 $1.00 降到 $0.25

    Fable 5 时代缓存读取按 0.1 倍输入价($1.00/百万 tokens)计费;Fable 5.1 直接把这一行改成 0.025 倍。同样的命中率,代理账单里最大的一行只剩四分之一。

  • 只有 Fable 5.1 和 Mythos 5.1 享受

    官方文档脚注写明:0.025 倍仅适用于这两个模型,Opus 5、Sonnet 5 等仍执行标准 0.1 倍。换句话说,缓存密集型负载第一次成为选旗舰的理由,而不是逃离它的理由。

  • 代理循环是最大受益者

    Claude Code 类产品的常态是每轮工具调用重读同一份大上下文。当大部分输入 tokens 都是读取时,你的实际单价是缓存读取价,而不是牌价输入价。

横向对比:各家缓存读取价

同一行指标在不同价卡上的位置(缓存读取,美元/百万 tokens,及相对输入价倍率)。

模型缓存读取相对输入价倍率
Claude Fable 5.1$0.250.025x
Claude Fable 5$1.000.1x
Claude Opus 5$0.500.1x
Claude Sonnet 5$0.200.1x
DeepSeek V4.1 Flash$0.0030.02x

DeepSeek 一行是官方闲时价(高峰 $0.006),自动前缀缓存、无写入费——但它是 $0.15/$0.60 价位的 Flash 级模型,与 Fable 5.1 不在同一能力档位。两个模型怎么取舍,见对比页。

算一遍:20 轮代理会话的真实账单

假设:固定前缀 50,000 tokens(系统提示 + 工具定义 + 文档),每次调用输出 2,000 tokens,共 20 次,5 分钟 TTL 全程续住。

不用缓存(Fable 5.1)
$12.00
用缓存(Fable 5.1)
$2.86
同样用缓存(Fable 5,$1 读取价)
$3.58
其中缓存读取行合计
$0.24

按上表价格计算:$12.00 → $2.86,省约 76%;其中 19 次缓存读取合计只占 $0.24。换成 Fable 5 的 $1.00 读取价,同一会话是 $3.58。数字随 token 量线性缩放,用计算器可以套你自己的负载。

怎么开:两种缓存方式

两种官方支持的方式,来自 Anthropic 文档。

  • 自动缓存

    在请求顶层加一个 cache_control 字段,系统自动管理缓存断点。官方推荐的默认选项,适合对话和代理循环。

  • 显式断点

    把 cache_control 精确放在某几个内容块上,决定哪些前缀进缓存。系统提示、工具定义和长文档分开控制时更划算。

  • 5 分钟还是 1 小时

    写入费 1.25 倍对应 5 分钟有效期,2 倍对应 1 小时,每次命中都会刷新计时。Fable 5.1 的读取价降到 0.025 倍后,1 小时档的盈亏点大约落在两次读取。

看每次响应里的 usage 字段:cache_creation_input_tokens 是本次写入量,cache_read_input_tokens 是本次读取量——账单核对就看这两个数。

把你自己的负载套进去

命中率、TTL 和轮数是这项优惠的三个变量。用计算器按你的真实 token 结构估一遍再决定。

常见问题