Opus 5 赢下了所有跑分。为什么老手却切回了 Fable 5?
Opus 5 以一半的价格领先每一项公开基准,但发布后 48 小时内,几位知名开发者却切回了 Fable 5。双方各自到底说了什么,以及如何在自己的任务上把这件事测清楚。

2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5,附带一张很难反驳的基准成绩表。48 小时之内,几位我们多年来一直信赖其判断的开发者说,他们试过了,然后切回了 Fable 5。
这两件事都摆在公开记录里。有意思的问题不是哪一方对,而是两者之间的落差告诉了我们什么——关于今天该怎么挑模型这件事。
跑分怎么说
以下是 Anthropic 公布的数字,核实于 2026 年 7 月 27 日:
- Frontier-Bench v0.1: Opus 5 得 43.3%,Fable 5 得 33.7%,Opus 4.8 得 18.7%。
- CursorBench 3.2: 在 max effort 下,Opus 5 与 Fable 5 的峰值差距在 0.5% 以内,单任务成本约为一半。
- ARC-AGI 3: 约为次优模型的 3 倍。
- Zapier AutomationBench: 在同等单任务成本下,通过率约为次优模型的 1.5 倍。
- OSWorld 2.0: 以略高于三分之一的成本,超过了 Fable 5 在计算机操作上的最好成绩。
Artificial Analysis 的智能指数上,max effort 下 Opus 5 为 61、Fable 5 为 60,单任务成本约 $2.03 对 $2.75。
再算上标价——$5/$25 每百万 token,对 Fable 5 的 $10/$50——从公开记录的任何一种读法看,Opus 5 都没有输。纸面上它处在同一个能力档位,价格减半,而且没有 Fable 5 那个强制 30 天数据留存。
一个你可以重跑的小型对照
图表与时间线之间的落差,本质上是关于任务质量的争论。要拿到第二意见,最便宜的办法是写几个小而可复现的任务,在两个模型上以对齐的 effort 各跑一遍。下面这四个是我们自己在 2026 年 7 月 28 日、在一个一次性仓库里跑的。它们是说明性的,不是受控研究——单次运行、没有统计效力、除模型 ID 外什么都没冻结。请把每一行当作一个你可以重跑的起点,而不是结论。数字为约数,截至 2026 年 7 月 28 日。
把一段 300 行的组件重构为 hook + reducer。 两个模型都在第一遍就给出了可用的拆分。Fable 5:通过,约 9.4k 入 / 2.1k 出 token,约 $0.20。Opus 5:通过,约 9.1k 入 / 1.8k 出,约 $0.09。
调试一个本地通过、CI 却失败的 flaky 测试。 Fable 5 用 3 轮找到了 mock fetch 里漏掉的 await 和一处非确定性的排序(约 $0.40)。Opus 5 用 2 轮、更少的重读找到了同样的两个问题(约 $0.16)。我们计分的这次两者都正确;换一个随机种子是否都能复现,未确认。
多文件改动:新增端点、接入客户端 hook、补一个测试。 Fable 5 一遍就完成了改动,但它补的测试直接复用了已有 fixture,而没有断言新字段(约 $0.27)。Opus 5 完成了改动并断言了新字段(约 $0.12)。
针对一个小型 monorepo 的仓库分析问题。 "失败的 webhook 重试逻辑到底住在哪里,有没有被覆盖?"Fable 5 用 2 轮给出了正确的地图(约 $0.16)。Opus 5 用 1 轮、大约少三分之一的输入 token 给出了同样的答案(约 $0.06)。
这四行告诉了我们什么。 按通过/失败计,两个模型都是 4/4,都很便宜;在任务质量上基本打平。可测出的差异在 Opus 5 的 token 效率——同一轮对照约 $0.43,对 Fable 5 的约 $1.03——而这恰恰是批评方大多略过的变量。四个任务上的打平,不等于在你工作上的打平。在相信之前,先自己重跑一遍。
如何重跑。 除模型 ID 外其余全部冻结——同一套 prompt、同样的仓库状态、同样的 effort 档位、同样的重试策略。每个模型每个任务各跑一次,记录是否解决、轮数、分别记录输入与输出 token、以及墙钟时间。按"每解决一个任务的成本"排序,而不是按通过率。以 $5/$25 每百万 token 计算,整轮对照大约只要一美元。不要从单次运行推出一般结论——包括这一次。
一线开发者怎么说
下面这些是个人就自己工作发表的公开表态。没有一条给出了任务集、方法论或 effort 档位,而且全都发生在发布后三天之内。请把它们当作信号,而不是证据。
Jeremy Howard 测试了 Opus 5 之后切回 Fable 5,称这个更新的模型在他的任务上是退步。
Kun Chenguid 的批评被 Peter Yang 转发,原文是:"opus 5 is nowhere near fable in practical use, not even close. anyone who's used it meaningfully can tell this very quickly after a few tasks. yet opus beats fable on many benchmarks."(Opus 5 在实际使用中远远不及 Fable,差得不是一点半点。任何认真用过它的人跑几个任务就能很快看出来。然而 Opus 在很多基准上却赢过 Fable。)同一条线程还走得更远,认为今天流行的公开基准已经不再具备信息量,真正值得信任的是建立在私有数据上的领域专用评测。
开发者 @badlogicgames 也表示自己切回了 Fable。
Yam Peleg 的转发是多数人看到这件事的途径。汇总见 digg.com/tech/2jlmpohd,检索于 2026 年 7 月 27 日。
注意这些表态里没有出现什么:这一组人当中,没有人公布过通过/失败的计数。一位长期有可信记录的人说"在我的工作上体感更差",这值得听——但它同时也正是那种无论是否具有普遍性、都能在现实面前活下来的说法。
反面的声音
这件事并不是一边倒。r/ClaudeAI 用户 /u/Meme_Theory 在 2026 年 7 月 25 日发了一帖,标题是"Opus 5 Token Usage is Amazing",说同样的工作在 Fable 5 上会吃掉他 Max x20 额度中相当可观的一部分,而在 Opus 5 上计数器几乎没怎么动,结果他也很满意。
这同样是个案,方法论上的分量和上面那些一样——也就是说,有一点。但它指向了批评方大多略过的一个变量:拿到这个答案花了多少钱,而不只是答案好不好。如果 Opus 5 用一半的 token、一半的单价得到一个略差一点的答案,那么"更差"和"更好"就已经不是合适的词了。
跑分与体感为什么会背离:四种可能
以下是假设,不是结论。没有人隔离出真正的原因,而且批评者完全有可能就是对的。
图表是在阶梯顶端跑出来的。 Anthropic 主推的 CursorBench 与 Frontier-Bench 成绩来自 max effort。而多数人实际在用的是 low、medium、high 这几档,xhigh 与 max 还仅限 API。如果你只是换了模型、保留了默认配置,那你部署的并不是图表里的那个模型。
prompt 会被带过来,行为不会。 一套针对 Fable 5 调了几周的 harness,里面固化了对那个模型的假设:它怎么规划、什么时候停、动手前会读多少东西。只换模型 ID,等于保留了脚手架、却换掉了它当初围绕塑形的那个东西。任何模型发布后的第一周,测到的失配和测到的模型本身一样多。
基准评的是终点,你感受的是过程。 基准记录的是最终 diff 能不能过。而坐在 agent 旁边时,你注意到的是绕路、反复重读、以及第四步那个自信的错误转向。两个模型可以收敛到同样的通过率,用起来却完全是两回事。
发布周的反馈是自选样本。 人们在新模型让自己意外时才会发帖,无论哪个方向。那些改了一行、然后继续正常干活的开发者,没有理由专门写一条线程。声量的数量不等于一个样本。
在自己的任务上把它测清楚
过去这几天最诚实的结论是:公开基准和公开舆论现在分歧得足够频繁,以至于两者都替代不了一次本地测量。好消息是,本地测量很便宜。
- 从自己的历史里挑 10 到 20 个任务。 已关闭的工单、已合并的 PR、真实的支持会话——那些你已经知道"正确结果长什么样"的工作。合成 prompt 只会复现你写它时带进去的偏见。
- 除模型 ID 外其余全部冻结。 同一套系统提示、同一套工具、同样的仓库状态、同样的重试策略。如果你为一个模型调了 prompt,那就给两个都调,否则你测的是自己的调参。
- 先对齐 effort 档位,再变动它。 两个模型都在你真正会上线的档位跑一遍,记录结果,然后把 Opus 5 提高一档再跑。即便如此,成本差距也可能仍然对你有利。
- 每次记录四个数: 是否解决、用了多少轮、输入与输出 token 分开记、墙钟时间。在对 transcript 形成看法之前先把这些写下来——先读推理过程会影响你的打分。
- 按"每解决一个任务的成本"排序。 只看通过率会藏起重试,只看 token 数会藏起失败。少一次重跑对这道算术的影响,比任何单个基准分数都大。
- 任一模型更新后重跑。 两个模型都只有几周大。你今天得出的任何结论保质期都很短,包括这篇文章。
以 $5/$25 每百万 token 计算,二十个任务、两个模型的对照通常只要几美元。这个预算,比你已经花在读争论上的时间还小。
没有争议的部分
在质量问题悬而未决的同时,有几条与决策直接相关的事实并无争议:
- Opus 5 标价 $5/$25 每百万 token,Fable 5 为 $10/$50;缓存读取 $0.50,Batch 为 $2.50/$12.50。
- Opus 5 常规访问无数据留存要求。Fable 5 强制 30 天,且不适用零数据留存协议。如果合规评审曾在你公司挡下 Fable 5,那个障碍现在没有了。
- Opus 5 是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型,订阅价格不变。
- Fable 5 已于 2026 年 7 月 20 日从 Pro 与 Team Standard 移出,改为一次性 $100 credit;在 Max 与 Team Premium 上仍然包含,上限为周额度的 50%。
对不少团队来说,数据留存这一条在基准表拿到投票权之前,就已经把问题定下来了。
结论
如果你是从零开始一个新项目,Opus 5 是合理的默认选择:在每一项公开测量上处于同一能力档位、价格一半、合同层面的麻烦更少。如果你已经有一套调好的 Fable 5 harness,产出质量可以、成本也能接受,那么这周去动它的理由并不充分——而且公开这么说的那几个人,通常不是会看错的人。
不该做的,是让基准表或者时间线替你做决定。这两样东西都比一次真实测量更容易获得,价值也相应地低。
规格与定价的逐项差异,见 Claude Fable 5 与 Claude Opus 5 对比。想在决定之前把自己的月用量放进两套价格里算一遍,用成本计算器。
基准与定价数字来自 Anthropic 公开材料及 Artificial Analysis,核实于 2026 年 7 月 27 日。社区表态检索于 2026 年 7 月 27 日,来源为 digg.com/tech/2jlmpohd 与 r/ClaudeAI。独立分析,与 Anthropic 无关联。