来源:Anthropic 2026 年 6 月 9 日发布表格
Claude Fable 5 基准测试
完整的官方表格——80.3% SWE-Bench Pro,公开模型最高分——外加发布稿里被埋没的诚实解读:哪些星标行属于 Mythos 5,为什么安全拦截域的分数只有 Opus 4.8 水平。
基准测试——以及那条诚实的脚注
Anthropic 公布的结果显示 Fable5 在代理编码与知识工作上领先。完整表格在此,还有发布稿里容易被忽略的关键说明。
| 基准测试 | Fable5 / Mythos 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro(编码) | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode(Diamond) | 29.3% | 13.4% | 5.7% | — |
| GDPval-AA(知识工作) | 1932 | 1890 | 1769 | 1314 |
| GDP.pdf(无工具视觉) | 29.8% | 22.5% | 24.9% | 16.7% |
| OSWorld-Verified(电脑使用) | 85.0% | 83.4% | 78.7% | 76.2% |
在涉及网络安全与生物学的评测(如 ExploitBench)中,Fable5 受安全机制限制,得分接近 Opus 4.8——官方公布的高分属于未受限的 Claude Mythos 5。来源:Anthropic 公告,2026 年 6 月 9 日。
如何诚实解读这些数字
- Anthropic 表格中的星标行——ExploitBench 等网络安全与生物学评测——是 Claude Mythos 5 的分数,不是 Fable 5。分数是真的,但你几乎不可能复现。
- 在安全拦截域,Fable 5 自己的成绩接近 Opus 4.8——因为分类器触发时,实际作答的就是 Opus 4.8。7 月 1 日恢复后,在新分类器调优期间部分常规编码请求也会暂时回退到 Opus。
- 编码、知识工作和电脑操作的分数是货真价实的 Fable 5 成绩——这些项目,公布的就是你能得到的。
经验法则:如果某个领域敏感到会触发 Fable 5 的安全机制,公布的最高分就属于 Mythos 5——而你实际体验到的分数属于 Opus 4.8。
与其他模型的对比
Fable 5 在 SWE-Bench Pro 上领先 GPT-5.5 22 个百分点、FrontierCode 上是其 5 倍,领先 Gemini 3.1 Pro 26 个百分点——但价格大约是它们的 4-8 倍。Sonnet 5(首发价 $2/$10)以接近 Opus 的质量覆盖大部分日常编码。完整对比: