出典:Anthropic 2026年6月9日のローンチ表
Claude Fable 5 ベンチマーク
公開された全表 — 公開モデル最高の 80.3% SWE-Bench Pro — に加え、ローンチ記事が埋もれさせている正直な読み方:どの星付き行が Mythos 5 のものか、なぜセーフガード対象ドメインのスコアが Opus 4.8 水準になるのか。
ベンチマーク — 正直な脚注つき
Anthropic の公表結果では Fable5 がエージェントコーディングとナレッジワークでリード。完全な表と、ローンチ記事が埋めている注意点を示します。
| ベンチマーク | Fable5 / Mythos 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro(コーディング) | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode(Diamond) | 29.3% | 13.4% | 5.7% | — |
| GDPval-AA(ナレッジワーク) | 1932 | 1890 | 1769 | 1314 |
| GDP.pdf(ビジョン、ツールなし) | 29.8% | 22.5% | 24.9% | 16.7% |
| OSWorld-Verified(コンピュータ操作) | 85.0% | 83.4% | 78.7% | 76.2% |
サイバーセキュリティと生物学の評価(例:ExploitBench)では、Fable5 のセーフガードによりスコアは Opus 4.8 付近に制限されます — そこで公表されているトップスコアは無制限版の Claude Mythos 5 のものです。出典:Anthropic 発表、2026年6月9日。
この数字を正直に読む方法
- Anthropic の表の星付き行 — ExploitBench などのサイバーセキュリティ・生物学評価 — は Claude Mythos 5 のスコアであり、Fable 5 ではありません。本物のスコアですが、ほぼ確実に再現できません。
- セーフガード対象ドメインでは、Fable 5 自身の結果は Opus 4.8 に近くなります — 分類器が作動したとき、実際に回答しているのは文字通り Opus 4.8 だからです。7月1日の復旧以降は、新しい分類器の調整中、一部の通常コーディングリクエストも一時的に Opus にフォールバックします。
- コーディング、ナレッジワーク、コンピュータ操作のスコアは正真正銘の Fable 5 の結果です — これらは公表どおりの性能が得られます。
経験則:Fable 5 のセーフガードが作動するほど制限されたドメインなら、公表されたトップスコアは Mythos 5 のもの — そしてあなたが実際に体験するスコアは Opus 4.8 のものです。
他モデルとの比較
Fable 5 は SWE-Bench Pro で GPT-5.5 を22ポイント、FrontierCode で約5倍リードし、Gemini 3.1 Pro には SWE-Bench Pro で26ポイント差 — ただし価格はおよそ4〜8倍です。Sonnet 5(導入価格 $2/$10)は日常のコーディングの大半を Opus に近い品質でカバーします。詳細比較: