ブログに戻る

Claude Fable 5.1 正式リリース:SWE-bench 87.7%、思考予算、最新ベンチマーク徹底解説

Anthropicが2026年9月2日にClaude Fable 5.1を発表。SWE-bench Verified、FrontierMath、HLEベンチマーク結果、アダプティブ思考予算、遅延改善、Qwen 3.8 MaxやGLM 5.3との比較を詳細解説。

2026年9月2日Fable5 編集部Fable5 編集部
Claude Fable 5.1 正式リリース:SWE-bench 87.7%、思考予算、最新ベンチマーク徹底解説

2026年9月2日、Anthropicは最新フラグシップモデル Claude Fable 5.1(正式識別子:claude-fable-5-1-20260902)をリリースしました。Opus 5の登場や各社最新モデル(Qwen 3.8 Max、GLM 5.3、Kimi K3、DeepSeek V4)の公開が続く中、Fable 5.1はソフトウェア開発と複雑推論における新たな頂点を打ち立てました。


1. 主要ベンチマーク結果

ベンチマークClaude Fable 5.1Claude Fable 5.0変化主な評価領域
SWE-bench Verified87.7%80.3%+7.4%実際のGitHubバグ修正成功率
FrontierMath38.2%29.3%+8.9%専門研究レベルの数学推論
Humanity's Last Exam (HLE)61.4%53.0%+8.4%複合領域における難解論理
OSWorld89.6%85.0%+4.6%OSおよびGUI自律操作
GDPval-AA2,0481,932+116点自律エージェント総合指数
初回トークン遅延 (TTFT)-28%基準-28%CLI(Claude Code/Cursor)での体感速度
安全フォールバック発生率~2.1%~7.8%-73%誤ったOpus 4.8転送の減少

2. アダプティブ思考予算機能

従来の離散的な思考レベル設定に加え、Fable 5.1ではトークン予算を数値で直接指定可能になりました:

{
  "model": "claude-fable-5-1-20260902",
  "max_tokens": 16384,
  "thinking": {
    "type": "enabled",
    "budget_tokens": 4096
  },
  "messages": [...]
}

これにより、シンプルなタスクでの考えすぎを防ぎ、コストを最適化できます。


3. 移行と料金

  • 価格据え置き:入力$10 / 出力$50 / キャッシュ読取$1(100万トークンあたり)。
  • 完全互換claude-fable-5-1-20260902 に書き換えるだけで移行完了。

詳細は Fable 5.1 vs Fable 5 徹底比較ページ または 対話型コスト計算ツール をご覧ください。

関連記事