Claude Fable5 と Gemini 3.1 Pro を徹底比較 — ベンチマーク・料金・結論
Fable5 は SWE-Bench Pro で Gemini 3.1 Pro を26ポイント上回りますが、価格は約4倍です。各モデルが勝つ場面、ベンチマーク表が隠していること、タスク単位のルーティングによる結論を解説します。

本記事はリリース週の日付付き分析です。 出典付きのベンチマークと最新価格を継続更新する比較ページは、Claude Fable 5 vs Gemini 3.1 Pro をご覧ください。
この比較の正直なバージョンは、リリース週の記事の多くが省略する免責事項から始まります:ラボ横断のベンチマークは、各ラボ自身が、自ら選んだ設定で実施したものだということです。それを踏まえた上で — Claude Fable5 と Gemini 3.1 Pro の公開スコアの差は異例なほど大きく、何を買うかによって指し示す方向が変わります。
ベンチマーク表と、正直な脚注
| ベンチマーク | Fable5 | Gemini 3.1 Pro |
|---|---|---|
| SWE-Bench Pro(エージェントコーディング) | 80.3% | 54.2% |
| FrontierCode(Diamond) | 29.3% | —(公開スコアなし) |
| GDPval-AA(ナレッジワーク) | 1932 | 1314 |
| GDP.pdf(視覚、ツールなし) | 29.8% | 16.7% |
| OSWorld-Verified(コンピュータ操作) | 85.0% | 76.2% |
リリース記事が埋もれさせている脚注が2つあります。第一に、サイバーセキュリティと生物学の評価では、Fable5 のセーフガードによってスコアが Opus 4.8 付近に抑えられています — そこでの見出しの数字は、制限付きの Mythos 5 のものです。第二に、Gemini の FrontierCode のエントリが欠けていることは必ずしも致命的ではありません — Google が単に公開していないだけです — が、得られるのは「証拠の不在」だけです。
料金:差は逆方向に走る
- Fable5: トークン100万あたり入力 $10 / 出力 $50。プロンプトキャッシュでキャッシュ済み入力は90%オフ、Batch API ですべてが50%オフになります。
- Gemini 3.1 Pro: およそ入力 $2 / 出力 $12(200K トークン以下のプロンプト。長いコンテキストの料金はより高くなります)。コンテキストキャッシュの割引も適用されます。
定価では、Gemini 3.1 Pro が約 4〜5倍安いです。大量の本番トラフィック — 要約、抽出、チャット — では、この倍率がすべてを物語ります。両方のモデルがこなせる作業において、5倍の価格差を覆せるベンチマークのリードはありません。コスト計算ツールでご自身のワークロードの数字を試算してください。
各モデルが実際に勝つ場面
Fable5 にルーティングすべきとき:
- タスクがエージェント型で長いとき。 SWE-Bench Pro の26ポイント差は、数時間に及ぶ自律実行ではさらに広がります — これこそ Fable5 が作られたワークロードです。
- 本当のコストがリトライにあるとき。 最難関の問題では、トークンあたりのコストより「解決したタスクあたりのコスト」が重要であり、安いモデルの失敗した試行はタダではありません。Opus 4.8 に勝つのと同じリトライの計算は、5倍の価格差ではより強く効きます — ただし、安いモデルが本当にそのタスクを解けない場合に限ります。
- 文書が高密度で視覚的なとき。 GDP.pdf(ツールなしの視覚タスク)の 29.8% 対 16.7% は、この表の隠れた見出しです。
Gemini 3.1 Pro にルーティングすべきとき:
- ボリュームが支配的なとき。 両モデルが品質基準を満たす本番トラフィックは、問答無用で安いモデルに任せるべきです。
- Google スタックの中で暮らしているとき。 Workspace、Vertex AI パイプライン、Google のグラウンディング/検索ツールとのネイティブ統合には、どのベンチマークも捉えられない実際のワークフロー上の価値があります。
- レイテンシが機能であるとき。 高 effort の Fable5 は長く考えます。インタラクティブな製品は待てないことが多いものです。
誰も触れないプロンプトの違い
Fable5 は temperature と top_p を完全に廃止しました — 出力スタイルはプロンプトと effort パラメータで制御します。Gemini は従来のサンプリング制御を維持しています。実務上の帰結:Gemini から Fable5 に移植するプロンプトでは、サンプリング依存のテクニックを取り除き、望むばらつきを明示的に記述すべきです。プロンプトジェネレーターは Fable5 ネイティブなプロンプトを組み立てます。残りは移行ノートが解説しています。
結論
モデル単位ではなく、タスク単位で:
- 最難関のコーディング、長いエージェント実行、高密度文書の視覚処理 → Fable5
- 大量の本番処理、Google スタック統合、レイテンシ重視の UX → Gemini 3.1 Pro
- 混在するワークロード → Gemini(または Opus 5)をデフォルトレーンに、それに見合う10〜20%のタスクのエスカレーションレーンとして Fable5 を。分割コストを試算する。
FAQ
Fable5 は Gemini 3.1 Pro より優れていますか? 公開ベンチマークでは、優れています — SWE-Bench Pro で26ポイント、GDPval-AA で618ポイントの差です。価格とレイテンシでは、同程度の差で Gemini が勝ちます。
この比較は公平ですか? 方向性を示すものとして扱ってください。ラボ自身が公開した数字で、設定も異なり、Gemini には比較できる FrontierCode のスコアがありません。
両方を併用できますか? それが推奨パターンです:安価なデフォルトレーン、高価なエスカレーションレーン、明示的なルーティングルール。統合面を1つにまとめたい場合、どちらの API も OpenRouter に対応しています。
ベンチマークの数値は、Anthropic の2026年6月9日の発表および Google が公開した Gemini 3.1 Pro の結果(2026年6月10日時点)に基づきます。独立した分析です — 完全な Fable5 ガイドもご覧ください。