API 参数 · output_config.effort

Claude Fable 5 的 effort 参数,一篇讲透

在 Fable 5 上,effort 取代 temperature,成为唯一值得调的旋钮。五个档位控制模型投入多少推理——这里讲清每一档对你的 token、延迟和账单分别意味着什么。

TL;DR — 30 秒结论

effort 是 API 参数(output_config.effort),控制 Fable 5 的推理预算,共五档:low、medium、high、xhigh、max。默认 high,也是多数场景的甜点档。输出 token 在整个区间内约为 high 的 0.25×–1.9×——一个公开测量里,同一提示词在 low 下产出约 1,900 输出 token,在 max 下约 14,400(约 7.6 倍)。输入在任何档位都按原价计费,所以成本差距在输出密集的任务上最明显。结果不理想时,先在原档位把提示词写清楚重试一次,再考虑升档。

五档对比

Anthropic 公布了档位名称和默认值(high),但没有公布成本曲线——下表倍数以一次实测为锚点、其余为估算(见表下注释)。token 与成本两行所用的代表性 workload 见「成本」一节。

档位lowmediumhighxhighmax
适合最快最省——常规转换、分类、轻量对话均衡之选——日常写码与起草默认档——正经工程与多数生产 agent深度档——疑难调试、终审,Claude Code 的默认上限档——最难题,正确性优先于成本
输出 token(相对 high)0.25×0.5×1.45×1.9×
每次请求输出 token5,00010,00020,00029,00038,000
月成本$4,934$5,177$5,665$6,104$6,542

倍数以 high 为基准。目前只有 low 与 max 的比值是实测的(Simon Willison 2026 年 6 月的 pelican-SVG 测试),中间档位为插值。token 与成本行采用下文「成本」一节的 workload 口径。

价格与 effort 估算核实日期: 2026-08-04

effort 怎么影响账单

同一个 workload 跑五个档位——上面 token 与成本两行的计算口径就是它。

成本项high(默认)max
新输入($10/M)$3,705$3,705
缓存命中($1/M)$864.50$864.50
输出($50/M)$950.00$1,805
安全兜底$145.25$167.75
合计$5,665$6,542

口径:每月 1,000 次请求,每次 1M 输入 token(按约 30% 的 tokenizer 通胀折算,70% 命中 prompt 缓存)与 20K 输出 token(high 档)。5% 的请求由 Opus 4.8 安全兜底回答。价格为 Fable 5 公布的 $10/$50 每百万 token。

effort 只动「输出」这一列——输入账单在任何档位都完全一样。这个 mix 里输入与缓存占大头,所以 low 到 max 总额只差约 15%,尽管输出 token 差了约 7.6 倍。输出密集的任务(生成代码、长报告、agent 循环)差距会被放大;聊天为主的任务则几乎无感。这也是为什么「贵模型开 low」常常比「便宜模型开 high」更划算。

以上数字与本站成本计算器共用同一个估算函数,仅四舍五入显示。Anthropic 未公布 effort 成本曲线——0.25×/0.5×/1×/1.45×/1.9× 的倍数由唯一实测锚点插值而来(Simon Willison 的 pelican-SVG 测试:同一提示词在 low 下约 1,900、max 下约 14,400 输出 token,2026-06-09)。

先重试,再升档

结果不行,多半是提示词的问题,而不是 effort 不够。按这个顺序花最少的钱:

  • 同一档位、更好的提示词,先重试一次

    大多数浅尝辄止的失败源于需求没写清楚,而不是推理深度不够。把目标、约束和「做到什么算完」写明白,原档位再跑一次——这比直接升档便宜得多。

  • 真要升档,一次只升一档

    low → medium → high → xhigh → max。每一档都增加推理深度,也增加延迟与 token;直接跳到 max 会错过边际收益开始消失的那一档。编码与 agent 场景的实际天花板是 xhigh——max 留给极少数正确性压倒一切的场景。

  • 延迟也是成本

    max 档下单次 Fable 5 请求可能跑上好几分钟。两次 high 的重试可能比一次 max 更快跑完——交互式工作里,墙钟时间就是真金白银的预算。

  • 升档之前先看账单

    输出 token 随档位放大,而输出恰恰是贵的方向(Fable 5 输出 $50/M)。输入密集的任务各档差异很小,输出密集则不然。两次 medium 在成本与覆盖面上都可能胜过一次 max。

拿你自己的 workload 算一遍

本网站的成本计算器用同一个估算函数跑你的数字——输入结构、缓存命中率、effort 档位与兜底比例都能调。

常见问题