ブログに戻る

Claude Fable5 と Gemini 3.1 Pro を徹底比較 — ベンチマーク・料金・結論

Fable5 は SWE-Bench Pro で Gemini 3.1 Pro を26ポイント上回りますが、価格は約4倍です。各モデルが勝つ場面、ベンチマーク表が隠していること、タスク単位のルーティングによる結論を解説します。

2026年6月10日Fable5 編集部Fable5 編集部
Claude Fable5 と Gemini 3.1 Pro を徹底比較 — ベンチマーク・料金・結論

本記事はリリース週の日付付き分析です。 出典付きのベンチマークと最新価格を継続更新する比較ページは、Claude Fable 5 vs Gemini 3.1 Pro をご覧ください。

この比較の正直なバージョンは、リリース週の記事の多くが省略する免責事項から始まります:ラボ横断のベンチマークは、各ラボ自身が、自ら選んだ設定で実施したものだということです。それを踏まえた上で — Claude Fable5 と Gemini 3.1 Pro の公開スコアの差は異例なほど大きく、何を買うかによって指し示す方向が変わります。

ベンチマーク表と、正直な脚注

ベンチマークFable5Gemini 3.1 Pro
SWE-Bench Pro(エージェントコーディング)80.3%54.2%
FrontierCode(Diamond)29.3%—(公開スコアなし)
GDPval-AA(ナレッジワーク)19321314
GDP.pdf(視覚、ツールなし)29.8%16.7%
OSWorld-Verified(コンピュータ操作)85.0%76.2%

リリース記事が埋もれさせている脚注が2つあります。第一に、サイバーセキュリティと生物学の評価では、Fable5 のセーフガードによってスコアが Opus 4.8 付近に抑えられています — そこでの見出しの数字は、制限付きの Mythos 5 のものです。第二に、Gemini の FrontierCode のエントリが欠けていることは必ずしも致命的ではありません — Google が単に公開していないだけです — が、得られるのは「証拠の不在」だけです。

料金:差は逆方向に走る

  • Fable5: トークン100万あたり入力 $10 / 出力 $50。プロンプトキャッシュでキャッシュ済み入力は90%オフ、Batch API ですべてが50%オフになります。
  • Gemini 3.1 Pro: およそ入力 $2 / 出力 $12(200K トークン以下のプロンプト。長いコンテキストの料金はより高くなります)。コンテキストキャッシュの割引も適用されます。

定価では、Gemini 3.1 Pro が約 4〜5倍安いです。大量の本番トラフィック — 要約、抽出、チャット — では、この倍率がすべてを物語ります。両方のモデルがこなせる作業において、5倍の価格差を覆せるベンチマークのリードはありません。コスト計算ツールでご自身のワークロードの数字を試算してください。

各モデルが実際に勝つ場面

Fable5 にルーティングすべきとき:

  1. タスクがエージェント型で長いとき。 SWE-Bench Pro の26ポイント差は、数時間に及ぶ自律実行ではさらに広がります — これこそ Fable5 が作られたワークロードです。
  2. 本当のコストがリトライにあるとき。 最難関の問題では、トークンあたりのコストより「解決したタスクあたりのコスト」が重要であり、安いモデルの失敗した試行はタダではありません。Opus 4.8 に勝つのと同じリトライの計算は、5倍の価格差ではより強く効きます — ただし、安いモデルが本当にそのタスクを解けない場合に限ります
  3. 文書が高密度で視覚的なとき。 GDP.pdf(ツールなしの視覚タスク)の 29.8% 対 16.7% は、この表の隠れた見出しです。

Gemini 3.1 Pro にルーティングすべきとき:

  1. ボリュームが支配的なとき。 両モデルが品質基準を満たす本番トラフィックは、問答無用で安いモデルに任せるべきです。
  2. Google スタックの中で暮らしているとき。 Workspace、Vertex AI パイプライン、Google のグラウンディング/検索ツールとのネイティブ統合には、どのベンチマークも捉えられない実際のワークフロー上の価値があります。
  3. レイテンシが機能であるとき。 高 effort の Fable5 は長く考えます。インタラクティブな製品は待てないことが多いものです。

誰も触れないプロンプトの違い

Fable5 は temperature と top_p を完全に廃止しました — 出力スタイルはプロンプトと effort パラメータで制御します。Gemini は従来のサンプリング制御を維持しています。実務上の帰結:Gemini から Fable5 に移植するプロンプトでは、サンプリング依存のテクニックを取り除き、望むばらつきを明示的に記述すべきです。プロンプトジェネレーターは Fable5 ネイティブなプロンプトを組み立てます。残りは移行ノートが解説しています。

結論

モデル単位ではなく、タスク単位で:

  • 最難関のコーディング、長いエージェント実行、高密度文書の視覚処理 → Fable5
  • 大量の本番処理、Google スタック統合、レイテンシ重視の UX → Gemini 3.1 Pro
  • 混在するワークロード → Gemini(または Opus 5)をデフォルトレーンに、それに見合う10〜20%のタスクのエスカレーションレーンとして Fable5 を。分割コストを試算する

FAQ

Fable5 は Gemini 3.1 Pro より優れていますか? 公開ベンチマークでは、優れています — SWE-Bench Pro で26ポイント、GDPval-AA で618ポイントの差です。価格とレイテンシでは、同程度の差で Gemini が勝ちます。

この比較は公平ですか? 方向性を示すものとして扱ってください。ラボ自身が公開した数字で、設定も異なり、Gemini には比較できる FrontierCode のスコアがありません。

両方を併用できますか? それが推奨パターンです:安価なデフォルトレーン、高価なエスカレーションレーン、明示的なルーティングルール。統合面を1つにまとめたい場合、どちらの API も OpenRouter に対応しています。

ベンチマークの数値は、Anthropic の2026年6月9日の発表および Google が公開した Gemini 3.1 Pro の結果(2026年6月10日時点)に基づきます。独立した分析です — 完全な Fable5 ガイドもご覧ください。

関連記事