来源:Anthropic 2026 年 6 月 9 日发布表格

Claude Fable 5 基准测试

完整的官方表格——80.3% SWE-Bench Pro,公开模型最高分——外加发布稿里被埋没的诚实解读:哪些星标行属于 Mythos 5,为什么安全拦截域的分数只有 Opus 4.8 水平。

基准测试——以及那条诚实的脚注

Anthropic 公布的结果显示 Fable5 在代理编码与知识工作上领先。完整表格在此,还有发布稿里容易被忽略的关键说明。

基准测试Fable5 / Mythos 5Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro(编码)80.3%69.2%58.6%54.2%
FrontierCode(Diamond)29.3%13.4%5.7%
GDPval-AA(知识工作)1932189017691314
GDP.pdf(无工具视觉)29.8%22.5%24.9%16.7%
OSWorld-Verified(电脑使用)85.0%83.4%78.7%76.2%

在涉及网络安全与生物学的评测(如 ExploitBench)中,Fable5 受安全机制限制,得分接近 Opus 4.8——官方公布的高分属于未受限的 Claude Mythos 5。来源:Anthropic 公告,2026 年 6 月 9 日。

如何诚实解读这些数字

  • Anthropic 表格中的星标行——ExploitBench 等网络安全与生物学评测——是 Claude Mythos 5 的分数,不是 Fable 5。分数是真的,但你几乎不可能复现。
  • 在安全拦截域,Fable 5 自己的成绩接近 Opus 4.8——因为分类器触发时,实际作答的就是 Opus 4.8。7 月 1 日恢复后,在新分类器调优期间部分常规编码请求也会暂时回退到 Opus。
  • 编码、知识工作和电脑操作的分数是货真价实的 Fable 5 成绩——这些项目,公布的就是你能得到的。

经验法则:如果某个领域敏感到会触发 Fable 5 的安全机制,公布的最高分就属于 Mythos 5——而你实际体验到的分数属于 Opus 4.8。

与其他模型的对比

Fable 5 在 SWE-Bench Pro 上领先 GPT-5.5 22 个百分点、FrontierCode 上是其 5 倍,领先 Gemini 3.1 Pro 26 个百分点——但价格大约是它们的 4-8 倍。Sonnet 5(首发价 $2/$10)以接近 Opus 的质量覆盖大部分日常编码。完整对比:

基准测试常见问题

看清楚,再上 Fable5

先算清成本、弄懂安全回退、选对模型档位,再做决定。注册免费账号,规格、价格或渠道一有变化就通知你。