返回博客

Claude Fable5 对比 GPT-5.5——基准、价格与选型

Fable5 在 SWE-Bench Pro 上领先 GPT-5.5 22 个百分点,FrontierCode 是后者 5 倍——但价格约为 8 倍。完整对比,包括 GPT-5.5 赢下的那一行。

2026年6月10日Fable5 编辑部Fable5 编辑部
Claude Fable5 对比 GPT-5.5——基准、价格与选型

这是一篇标注日期、过时的分析。 带来源基准与最新价格的、持续维护的对比,见 Claude Fable 5 对比 GPT-5.5 页面。

这是所有人最先问的对比,也是公布数字最一边倒的对比——而且朝两个方向各倒一边。Claude Fable5 拿出了前沿模型之间我们见过的最大基准差距;GPT-5.5 拿出的价格让这些差距对多数生产流量来说无关紧要。两件事同时为真。

基准表

基准Fable5GPT-5.5
SWE-Bench Pro(agent 编码)80.3%58.6%
FrontierCode(Diamond)29.3%5.7%
GDPval-AA(知识工作)19321769
GDP.pdf(视觉、无工具)29.8%24.9%
OSWorld-Verified(计算机使用)85.0%78.7%

三条诚实注记。第一——这些是厂商自己公布的数字、设置由厂商自己选,当方向性参考。第二,GPT-5.5 的视觉成绩(24.9%)赢了 Claude Opus 4.8(22.5%)——如果你的负载重视觉、且在中端模型里二选一,这一行比头条更重要。第三,网络安全和生物学评测上 Fable5 的护栏把分数压到接近 Opus 4.8——不设限的数字属于买不到的 Mythos 5。

FrontierCode 才是真正的故事

SWE-Bench Pro 领先 22 个百分点已经很大。FrontierCode 5 倍(29.3% 对 5.7%)是另一个量级的差距。 FrontierCode Diamond 是"当前会失败的工程任务"最接近的公开代理——跨仓库重构、新型 debug、长程自主工作。5.7% 意味着 GPT-5.5 在这一档基本上不了场;29.3% 意味着 Fable5 有时可以。如果你的路线图里有你亲眼看着前沿模型失败过的任务,这一行就是整个对比。

价格:GPT-5.5 的反击

  • GPT-5.5: 每百万 token 输入 $1.25 / 输出 $10,缓存输入打 1 折。
  • Fable5: 输入 $10 / 输出 $50,缓存输入打 1 折,Batch API 5 折。

输入差 8 倍,输出差 5 倍。 对话产品、抽取流水线、摘要——一切两个模型都做得好的事情,GPT-5.5 的价格直接终结讨论。基准差距只在 GPT-5.5 真的失败、且重试(或人工)要花真金白银的任务上才赚得回溢价。成本计算器可以把两个模型连缓存一起建模。

各自赢在哪里

Fable5:

  1. 最难的工程。 FrontierCode 档——一次昂贵的尝试胜过 N 次便宜的失败。重试数学随价差扩大而更有力,但只在便宜模型真的解不出的地方成立。
  2. 数小时自主 agent。 Fable5 在数百万 token 中保持连贯并靠进度笔记自我纠错;SWE-Bench Pro 的差距在这里复利。
  3. 高风险知识工作。 GDPval-AA 领先 163 分,加上字面指令执行让输出契约真正具有约束力。

GPT-5.5:

  1. 一切大流量场景。 输入价格只有 1/8,默认通道归它(想留在 Claude 生态就用 $5/$25 的 Opus 5)。
  2. 预算内的视觉。 它对价格段之上模型也能赢的那一行。
  3. OpenAI 栈产品。 Structured outputs、Assistants 工具链和既有 GPT 集成的切换成本,没有基准能抵消。

Prompt:不要粘贴,要移植

GPT-5.5 保留 temperature/top_p、原谅松散 prompt。Fable5 移除了两个旋钮并字面执行指令——含糊的 prompt 得到字面化的结果,精确的 prompt 得到你要的东西。把 GPT-5.5 的 prompt 移到 Fable5:删掉采样技巧,把角色/任务/格式/约束显式写出来,并把完整规格放进第一条消息。prompt 生成器直接搭好这套结构;迁移指南讲清原理。

结论

  • 默认通道: GPT-5.5(或 Opus 5)——质量过线的地方,价格说了算。
  • 升级通道: Fable5——最难的编码、长自主运行、错不起的工作。
  • 重视觉的中端需求: 付 Claude 价格之前,先认真评测一轮 GPT-5.5。

做对这件事的团队不是在选冠军,而是在写路由规则。把分流建模算一遍

FAQ

Fable5 比 GPT-5.5 强吗? 按已公布基准,每一行都强,其中 FrontierCode 的 5 倍差距最有分量。价格上 GPT-5.5 完胜。

GPT-5.5 写代码够用吗? 常规任务够用,成本只有零头。最难一档,公布的 5.7% FrontierCode 成绩说明不够。

能通过一个 API 同时 A/B 两个模型吗? 能——两家都在 OpenRouter 上(anthropic/claude-fable-5),这是用同一套评测集跑两个模型摩擦最小的方式。

基准数字来自 Anthropic 2026 年 6 月 9 日公告及 OpenAI 已公布的 GPT-5.5 成绩,截至 2026 年 6 月 10 日。独立分析——另见完整 Fable5 指南Gemini 对比

相关文章