Claude Fable5 对比 GPT-5.5——基准、价格与选型
Fable5 在 SWE-Bench Pro 上领先 GPT-5.5 22 个百分点,FrontierCode 是后者 5 倍——但价格约为 8 倍。完整对比,包括 GPT-5.5 赢下的那一行。

这是一篇标注日期、过时的分析。 带来源基准与最新价格的、持续维护的对比,见 Claude Fable 5 对比 GPT-5.5 页面。
这是所有人最先问的对比,也是公布数字最一边倒的对比——而且朝两个方向各倒一边。Claude Fable5 拿出了前沿模型之间我们见过的最大基准差距;GPT-5.5 拿出的价格让这些差距对多数生产流量来说无关紧要。两件事同时为真。
基准表
| 基准 | Fable5 | GPT-5.5 |
|---|---|---|
| SWE-Bench Pro(agent 编码) | 80.3% | 58.6% |
| FrontierCode(Diamond) | 29.3% | 5.7% |
| GDPval-AA(知识工作) | 1932 | 1769 |
| GDP.pdf(视觉、无工具) | 29.8% | 24.9% |
| OSWorld-Verified(计算机使用) | 85.0% | 78.7% |
三条诚实注记。第一——这些是厂商自己公布的数字、设置由厂商自己选,当方向性参考。第二,GPT-5.5 的视觉成绩(24.9%)赢了 Claude Opus 4.8(22.5%)——如果你的负载重视觉、且在中端模型里二选一,这一行比头条更重要。第三,网络安全和生物学评测上 Fable5 的护栏把分数压到接近 Opus 4.8——不设限的数字属于买不到的 Mythos 5。
FrontierCode 才是真正的故事
SWE-Bench Pro 领先 22 个百分点已经很大。FrontierCode 5 倍(29.3% 对 5.7%)是另一个量级的差距。 FrontierCode Diamond 是"当前会失败的工程任务"最接近的公开代理——跨仓库重构、新型 debug、长程自主工作。5.7% 意味着 GPT-5.5 在这一档基本上不了场;29.3% 意味着 Fable5 有时可以。如果你的路线图里有你亲眼看着前沿模型失败过的任务,这一行就是整个对比。
价格:GPT-5.5 的反击
- GPT-5.5: 每百万 token 输入 $1.25 / 输出 $10,缓存输入打 1 折。
- Fable5: 输入 $10 / 输出 $50,缓存输入打 1 折,Batch API 5 折。
输入差 8 倍,输出差 5 倍。 对话产品、抽取流水线、摘要——一切两个模型都做得好的事情,GPT-5.5 的价格直接终结讨论。基准差距只在 GPT-5.5 真的失败、且重试(或人工)要花真金白银的任务上才赚得回溢价。成本计算器可以把两个模型连缓存一起建模。
各自赢在哪里
Fable5:
- 最难的工程。 FrontierCode 档——一次昂贵的尝试胜过 N 次便宜的失败。重试数学随价差扩大而更有力,但只在便宜模型真的解不出的地方成立。
- 数小时自主 agent。 Fable5 在数百万 token 中保持连贯并靠进度笔记自我纠错;SWE-Bench Pro 的差距在这里复利。
- 高风险知识工作。 GDPval-AA 领先 163 分,加上字面指令执行让输出契约真正具有约束力。
GPT-5.5:
- 一切大流量场景。 输入价格只有 1/8,默认通道归它(想留在 Claude 生态就用 $5/$25 的 Opus 5)。
- 预算内的视觉。 它对价格段之上模型也能赢的那一行。
- OpenAI 栈产品。 Structured outputs、Assistants 工具链和既有 GPT 集成的切换成本,没有基准能抵消。
Prompt:不要粘贴,要移植
GPT-5.5 保留 temperature/top_p、原谅松散 prompt。Fable5 移除了两个旋钮并字面执行指令——含糊的 prompt 得到字面化的结果,精确的 prompt 得到你要的东西。把 GPT-5.5 的 prompt 移到 Fable5:删掉采样技巧,把角色/任务/格式/约束显式写出来,并把完整规格放进第一条消息。prompt 生成器直接搭好这套结构;迁移指南讲清原理。
结论
- 默认通道: GPT-5.5(或 Opus 5)——质量过线的地方,价格说了算。
- 升级通道: Fable5——最难的编码、长自主运行、错不起的工作。
- 重视觉的中端需求: 付 Claude 价格之前,先认真评测一轮 GPT-5.5。
做对这件事的团队不是在选冠军,而是在写路由规则。把分流建模算一遍。
FAQ
Fable5 比 GPT-5.5 强吗? 按已公布基准,每一行都强,其中 FrontierCode 的 5 倍差距最有分量。价格上 GPT-5.5 完胜。
GPT-5.5 写代码够用吗? 常规任务够用,成本只有零头。最难一档,公布的 5.7% FrontierCode 成绩说明不够。
能通过一个 API 同时 A/B 两个模型吗?
能——两家都在 OpenRouter 上(anthropic/claude-fable-5),这是用同一套评测集跑两个模型摩擦最小的方式。
基准数字来自 Anthropic 2026 年 6 月 9 日公告及 OpenAI 已公布的 GPT-5.5 成绩,截至 2026 年 6 月 10 日。独立分析——另见完整 Fable5 指南与 Gemini 对比。