出典:Anthropic 2026年6月9日のローンチ表

Claude Fable 5 ベンチマーク

公開された全表 — 公開モデル最高の 80.3% SWE-Bench Pro — に加え、ローンチ記事が埋もれさせている正直な読み方:どの星付き行が Mythos 5 のものか、なぜセーフガード対象ドメインのスコアが Opus 4.8 水準になるのか。

ベンチマーク — 正直な脚注つき

Anthropic の公表結果では Fable5 がエージェントコーディングとナレッジワークでリード。完全な表と、ローンチ記事が埋めている注意点を示します。

ベンチマークFable5 / Mythos 5Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro(コーディング)80.3%69.2%58.6%54.2%
FrontierCode(Diamond)29.3%13.4%5.7%
GDPval-AA(ナレッジワーク)1932189017691314
GDP.pdf(ビジョン、ツールなし)29.8%22.5%24.9%16.7%
OSWorld-Verified(コンピュータ操作)85.0%83.4%78.7%76.2%

サイバーセキュリティと生物学の評価(例:ExploitBench)では、Fable5 のセーフガードによりスコアは Opus 4.8 付近に制限されます — そこで公表されているトップスコアは無制限版の Claude Mythos 5 のものです。出典:Anthropic 発表、2026年6月9日。

この数字を正直に読む方法

  • Anthropic の表の星付き行 — ExploitBench などのサイバーセキュリティ・生物学評価 — は Claude Mythos 5 のスコアであり、Fable 5 ではありません。本物のスコアですが、ほぼ確実に再現できません。
  • セーフガード対象ドメインでは、Fable 5 自身の結果は Opus 4.8 に近くなります — 分類器が作動したとき、実際に回答しているのは文字通り Opus 4.8 だからです。7月1日の復旧以降は、新しい分類器の調整中、一部の通常コーディングリクエストも一時的に Opus にフォールバックします。
  • コーディング、ナレッジワーク、コンピュータ操作のスコアは正真正銘の Fable 5 の結果です — これらは公表どおりの性能が得られます。

経験則:Fable 5 のセーフガードが作動するほど制限されたドメインなら、公表されたトップスコアは Mythos 5 のもの — そしてあなたが実際に体験するスコアは Opus 4.8 のものです。

他モデルとの比較

Fable 5 は SWE-Bench Pro で GPT-5.5 を22ポイント、FrontierCode で約5倍リードし、Gemini 3.1 Pro には SWE-Bench Pro で26ポイント差 — ただし価格はおよそ4〜8倍です。Sonnet 5(導入価格 $2/$10)は日常のコーディングの大半を Opus に近い品質でカバーします。詳細比較:

ベンチマーク FAQ

目を開いたまま、Fable5 の上に築こう

コミットする前に、コスト計算、セーフガードの挙動、適切なティアを知っておきましょう。無料アカウントを作成すると、スペック・価格・アクセス経路の変更時に通知を受け取れます。