2026 年 7 月 27 日核实
在 Continue.dev 里使用 Claude Fable 5
一个围绕 token 预算设计的配置格式,撞上了一个把 token 预算删掉的模型。
一句话结论
用一段普通的 anthropic provider 配置就能支持 chat、edit 和 apply —— 但有一个值得在投入前知道的前提。Continue 的推理控制项是 reasoning 和 reasoningBudgetTokens,它们对应的是 Fable 5 已经拒绝的旧版 thinking budget;而我们在 config.yaml 参考文档里没有找到 effort 或 output_config 的直通字段。所以 Fable 5 会跑在默认的 high effort 上,唯一能降下来的办法是在中间架一层代理。
支持状态
能用,但有前提,2026 年 7 月 27 日核实。Continue 的 Anthropic provider 会接受你在 config.yaml 里写的任意 model ID,所以 claude-fable-5 不需要专门支持就能跑 —— 这一点和 Cline 的 curate 列表正好相反。前提出在参数一侧。Continue 文档化的 Anthropic 推理选项是布尔的 reasoning 和数值的 reasoningBudgetTokens,两者都源自 Claude 3.7 的 thinking budget 时代。Fable 5 已经彻底移除 budget_tokens,改用 output_config.effort;发旧的形状会返回 HTTP 400。截至核实日,我们在 Continue 的 config.yaml 参考里没有找到 effort 或 output_config 字段。
配置步骤
四步,其中第二步主要讲什么东西不要写。
- 1
打开你的 config.yaml
全局配置在 macOS/Linux 上是 ~/.continue,在 Windows 上是 %USERPROFILE%\.continue。只要存在 config.yaml,它就会替代旧的 config.json 被加载,所以要迁移,不要两个都留着。文件顶部需要 name、version 和 schema: v1。
- 2
加一条 provider 为 anthropic 的模型
在 models 下加一条:name、provider: anthropic、model: claude-fable-5、apiKey。roles 写 chat、edit、apply。不要在 defaultCompletionOptions 里加 temperature,也不要设 reasoning 或 reasoningBudgetTokens —— Fable 5 会用 400 拒绝采样参数和旧版 thinking budget。
- 3
打开 prompt 缓存
加上 defaultCompletionOptions,里面写 promptCaching: true。Continue 的文档把这个选项定义为「缓存系统消息和逐轮对话」的开关。以 Fable 5 的输入价格来说,这是整个文件里回报率最高的一行 —— 缓存读能省 90%。
- 4
重载配置,并给 autocomplete 换个模型
在 Continue 扩展的 config selector 里点 Reload config。然后再加一个小模型,roles 写 autocomplete —— 每次击键背后挂一个前沿推理模型,又慢又贵;何况 Fable 5 永远在思考,没有低延迟模式可退。
坑
三条坑同一个根源:Continue 的 Anthropic 选项比这一代模型更早。
千万别把 autocomplete 角色给 Fable 5
Continue 的默认角色是 chat、edit、apply、summarize,autocomplete 必须显式指定 —— 这个默认值是对的。把它指给 Fable 5,就等于让一个永远在思考、输入每百万 $10 的模型挂在 debounce 定时器上跑。这个角色留给一个专门的小模型。
没有 effort 字段,于是你按默认档付钱
Fable 5 的 effort 默认是 high,而在 low / medium / high / xhigh / max 这条刻度上,high 已经属于贵的那一端。Anthropic 自己的建议是:这个模型在 medium 和 low 上依然表现良好。可是没有直通字段,Continue 用户就没法在编辑器里拿到这个折扣 —— 变通办法是加一层 LiteLLM 或网关,由它注入 output_config。
reasoningBudgetTokens 会返回 400
Continue 为 Claude 3.7 及以后暴露了 reasoning 和 reasoningBudgetTokens,它们会生成带 budget_tokens 的 thinking 块。在 Fable 5 上这个参数已被移除:发它、或者发 thinking 的 enabled / disabled,都会返回 HTTP 400。错误文本里会点名这个参数,所以是可辨认的 —— 前提是你想到该去看自己的配置,而不是怀疑模型。
成本注意事项
因为 effort 卡在默认值,Continue 是本站唯一一个「你没法买一个更便宜的回答」的集成 —— 每个请求都是 high effort 请求,输入每百万 $10、输出每百万 $50。这让仅有的两个杠杆更重要:promptCaching: true 拿缓存读的 90% 折扣,以及角色拆分 —— 让 Fable 5 只拿 chat 角色,把 edit、apply、autocomplete 交给更便宜的模型。如果 effort 控制是硬需求,就在前面架 LiteLLM,在那里设 output_config。