API 参数 · output_config.effort
Claude Fable 5 的 effort 参数,一篇讲透
在 Fable 5 上,effort 取代 temperature,成为唯一值得调的旋钮。五个档位控制模型投入多少推理——这里讲清每一档对你的 token、延迟和账单分别意味着什么。
TL;DR — 30 秒结论
effort 是 API 参数(output_config.effort),控制 Fable 5 的推理预算,共五档:low、medium、high、xhigh、max。默认 high,也是多数场景的甜点档。输出 token 在整个区间内约为 high 的 0.25×–1.9×——一个公开测量里,同一提示词在 low 下产出约 1,900 输出 token,在 max 下约 14,400(约 7.6 倍)。输入在任何档位都按原价计费,所以成本差距在输出密集的任务上最明显。结果不理想时,先在原档位把提示词写清楚重试一次,再考虑升档。
五档对比
Anthropic 公布了档位名称和默认值(high),但没有公布成本曲线——下表倍数以一次实测为锚点、其余为估算(见表下注释)。token 与成本两行所用的代表性 workload 见「成本」一节。
| 档位 | low | medium | high | xhigh | max |
|---|---|---|---|---|---|
| 适合 | 最快最省——常规转换、分类、轻量对话 | 均衡之选——日常写码与起草 | 默认档——正经工程与多数生产 agent | 深度档——疑难调试、终审,Claude Code 的默认 | 上限档——最难题,正确性优先于成本 |
| 输出 token(相对 high) | 0.25× | 0.5× | 1× | 1.45× | 1.9× |
| 每次请求输出 token | 5,000 | 10,000 | 20,000 | 29,000 | 38,000 |
| 月成本 | $4,934 | $5,177 | $5,665 | $6,104 | $6,542 |
倍数以 high 为基准。目前只有 low 与 max 的比值是实测的(Simon Willison 2026 年 6 月的 pelican-SVG 测试),中间档位为插值。token 与成本行采用下文「成本」一节的 workload 口径。
价格与 effort 估算核实日期: 2026-08-04
effort 怎么影响账单
同一个 workload 跑五个档位——上面 token 与成本两行的计算口径就是它。
| 成本项 | high(默认) | max |
|---|---|---|
| 新输入($10/M) | $3,705 | $3,705 |
| 缓存命中($1/M) | $864.50 | $864.50 |
| 输出($50/M) | $950.00 | $1,805 |
| 安全兜底 | $145.25 | $167.75 |
| 合计 | $5,665 | $6,542 |
口径:每月 1,000 次请求,每次 1M 输入 token(按约 30% 的 tokenizer 通胀折算,70% 命中 prompt 缓存)与 20K 输出 token(high 档)。5% 的请求由 Opus 4.8 安全兜底回答。价格为 Fable 5 公布的 $10/$50 每百万 token。
effort 只动「输出」这一列——输入账单在任何档位都完全一样。这个 mix 里输入与缓存占大头,所以 low 到 max 总额只差约 15%,尽管输出 token 差了约 7.6 倍。输出密集的任务(生成代码、长报告、agent 循环)差距会被放大;聊天为主的任务则几乎无感。这也是为什么「贵模型开 low」常常比「便宜模型开 high」更划算。
以上数字与本站成本计算器共用同一个估算函数,仅四舍五入显示。Anthropic 未公布 effort 成本曲线——0.25×/0.5×/1×/1.45×/1.9× 的倍数由唯一实测锚点插值而来(Simon Willison 的 pelican-SVG 测试:同一提示词在 low 下约 1,900、max 下约 14,400 输出 token,2026-06-09)。
先重试,再升档
结果不行,多半是提示词的问题,而不是 effort 不够。按这个顺序花最少的钱:
同一档位、更好的提示词,先重试一次
大多数浅尝辄止的失败源于需求没写清楚,而不是推理深度不够。把目标、约束和「做到什么算完」写明白,原档位再跑一次——这比直接升档便宜得多。
真要升档,一次只升一档
low → medium → high → xhigh → max。每一档都增加推理深度,也增加延迟与 token;直接跳到 max 会错过边际收益开始消失的那一档。编码与 agent 场景的实际天花板是 xhigh——max 留给极少数正确性压倒一切的场景。
延迟也是成本
max 档下单次 Fable 5 请求可能跑上好几分钟。两次 high 的重试可能比一次 max 更快跑完——交互式工作里,墙钟时间就是真金白银的预算。
升档之前先看账单
输出 token 随档位放大,而输出恰恰是贵的方向(Fable 5 输出 $50/M)。输入密集的任务各档差异很小,输出密集则不然。两次 medium 在成本与覆盖面上都可能胜过一次 max。