Claude Fable5 と GPT-5.5 を徹底比較 — ベンチマーク・料金・選び方
Fable5 は SWE-Bench Pro で GPT-5.5 を22ポイント、FrontierCode で5倍上回ります — 価格は約8倍です。GPT-5.5 が勝つ唯一のベンチマークも含めた完全比較をお届けします。

これは日付付きの解説で、古くなっています。 出典付きベンチマークと最新価格を備え、継続的に更新される比較は Claude Fable 5 vs GPT-5.5 ページにあります。
これは誰もが最初に尋ねる比較であり、公開された数字が最も極端に偏っている比較でもあります — それも両方向に。Claude Fable5 はフロンティアモデル間で過去最大級のベンチマークリードを記録し、GPT-5.5 はそのリードを大半の本番トラフィックにおいて無意味にする価格を提示しています。どちらも事実です。
ベンチマーク表
| ベンチマーク | Fable5 | GPT-5.5 |
|---|---|---|
| SWE-Bench Pro(エージェントコーディング) | 80.3% | 58.6% |
| FrontierCode(Diamond) | 29.3% | 5.7% |
| GDPval-AA(ナレッジワーク) | 1932 | 1769 |
| GDP.pdf(視覚、ツールなし) | 29.8% | 24.9% |
| OSWorld-Verified(コンピュータ操作) | 85.0% | 78.7% |
正直な注記を3つ。第一に — これらはラボ自身が公開した数字で、設定もラボが選んだものです。方向性を示すものとして扱ってください。第二に、GPT-5.5 の視覚スコア(24.9%)は Claude Opus 4.8(22.5%)を上回っています — ワークロードが視覚中心で、ミドルティアのモデルから選ぶなら、見出しの数字よりこの行のほうが重要です。第三に、サイバーセキュリティと生物学の評価では、Fable5 のセーフガードによってスコアが Opus 4.8 付近に抑えられています — 制限なしの数字は、購入できない Mythos 5 のものです。
本当の話は FrontierCode にある
SWE-Bench Pro での22ポイントのリードは大きいです。FrontierCode での5倍のリード(29.3% 対 5.7%)は、それとは別次元の差です。 FrontierCode Diamond は「現時点で失敗するエンジニアリングタスク」に最も近い公開プロキシです — マルチリポジトリのリファクタリング、未知のデバッグ、長期の自律作業。5.7% の GPT-5.5 はこのティアでは事実上戦えず、29.3% の Fable5 は時に戦えます。フロンティアモデルが失敗するのをすでに見届けたタスクがロードマップにあるなら、この1行こそが比較のすべてです。
料金:GPT-5.5 の反撃
- GPT-5.5: トークン100万あたり入力 $1.25 / 出力 $10、キャッシュ済み入力は90%オフ。
- Fable5: 入力 $10 / 出力 $50、キャッシュ済み入力は90%オフ、Batch API で50%オフ。
つまり入力で8倍、出力で5倍の差です。チャット製品、抽出パイプライン、要約 — 両モデルが得意とするあらゆる作業 — では、GPT-5.5 の価格で議論は終わります。ベンチマークの差がプレミアムに見合うのは、GPT-5.5 が実際に失敗し、リトライ(あるいは人手)に実費がかかるタスクだけです。コスト計算ツールでは、キャッシュも含めて両方をモデル化できます。
各モデルが勝つ場面
Fable5:
- 最難関のエンジニアリング。 FrontierCode のティア — 高価な1回の試行が、安価な N 回の失敗に勝ちます。リトライの計算は価格差が広がるほど強く効きますが、安いモデルが本当に失敗する場面に限られます。
- 数時間に及ぶ自律エージェント。 Fable5 は数百万トークンにわたって一貫性を保ち、進捗メモで自己修正します。SWE-Bench Pro の差が複利的に効いてくるのはここです。
- 失敗の許されないナレッジワーク。 GDPval-AA での163ポイント差に加え、出力契約を実際に守らせる文字通りの指示遵守があります。
GPT-5.5:
- 大量処理のすべて。 入力価格が8分の1である以上、デフォルトレーンは GPT-5.5 のものです(Claude エコシステムに留まりたいなら $5/$25 の Opus 5 でも可)。
- 低予算での視覚タスク。 価格帯が上のモデルに勝てる唯一の行です。
- OpenAI スタックの製品。 Structured Outputs、Assistants のツール群、既存の GPT 統合には、どのベンチマークも相殺できない乗り換えコストがあります。
プロンプト:貼り付けではなく移植を
GPT-5.5 は temperature/top_p を維持し、緩いプロンプトも許容します。Fable5 は両方のパラメータを廃止し、指示を文字通りに実行します — 曖昧なプロンプトは杓子定規な結果を生み、正確なプロンプトは依頼どおりの結果を生みます。GPT-5.5 のプロンプトを Fable5 に移すには:サンプリング系のテクニックを取り除き、役割・タスク・形式・制約を明示し、最初のメッセージに完全な仕様を入れてください。プロンプトジェネレーターはこの構造の土台を作り、プロンプトガイドが移行を解説しています。
結論
- デフォルトレーン: GPT-5.5(または Opus 5)— 品質が基準を満たす限り、価格が勝ちます。
- エスカレーションレーン: Fable5 — 最難関のコーディング、長い自律実行、失敗のコストが高い作業。
- 視覚中心のミドルティア: Claude の価格を払う前に、GPT-5.5 をきちんと評価してみてください。
これを正しくやっているチームは、勝者を1つ選んではいません — ルーティングルールを書いています。分割構成を試算する。
FAQ
Fable5 は GPT-5.5 より優れていますか? 公開ベンチマークでは、優れています — 全項目で勝っており、中でも FrontierCode の差(5倍)が最も重大です。価格では GPT-5.5 が決定的に勝ちます。
GPT-5.5 はコーディングに十分ですか? 日常的なタスクには十分で、コストはごく一部で済みます。最難関のティアについては、公開された 5.7% という FrontierCode のスコアが「不十分」と告げています。
1つの API で両者を A/B テストできますか?
はい — どちらも OpenRouter(anthropic/claude-fable-5)にあり、同じ評価セットを両方に対して走らせる最も手軽な方法です。
ベンチマークの数値は、Anthropic の2026年6月9日の発表および OpenAI が公開した GPT-5.5 の結果(2026年6月10日時点)に基づきます。独立した分析です — 完全な Fable5 ガイドと Gemini 比較もご覧ください。