核实日期:2026 年 8 月 4 日

Claude Fable 5 —— 全模型对比总览

一页看清全貌:Claude Fable 5 与 Anthropic 自家产品线、以及 2026 年所有重要竞品的对比——价格、agent 编码、上下文、开源与最佳场景。每个数字都标注日期与来源,并链接到各模型的完整对比页。

结论速览 —— 一句话看懂 Fable 5

Claude Fable 5 是 Anthropic 公开成绩最高的 agent 编码模型——SWE-Bench Pro 80.3%,每百万 token $10/$50——但它已不再是 Claude 的默认模型:自 2026 年 7 月 24 日起,Claude Opus 5 成为 Claude Max 的默认模型,以一半价格($5/$25)匹配 Fable 5 的能力区间,且没有强制数据留存。最难的 agent 任务——长时自主运行、前沿级编码、整仓库 1M 上下文分析——选 Fable 5;其余一切选 Opus 5(或更便宜的竞品)。下表一眼看全九款替代。

最后核实2026-08-04

本页价格与基准数字均于 2026 年 8 月 4 日对照所引来源核实。Anthropic 数据来自 src/lib/model-pricing.ts(对照 Anthropic 定价文档);竞品数据来自本站各对比页(各自注明日期与来源)及下方所列厂商页面。凡无法确认的数字一律标注「not confirmed」并注明日期。

主对比矩阵

API 每百万 token 标价(美元)与决定多数选择的关键事实。完整背景与说明见下文及各对比页。

模型输入(每百万)输出(每百万)上下文开源权重最佳场景来源
Claude Fable 5$10.00$50.001MClosed API前沿 agent 编码官方(厂商文档)
Claude Opus 5$5.00$25.001MClosed API默认车道,无留存官方(厂商文档)
Claude Sonnet 5$2.00*$10.00*1MClosed API均衡的 Claude 层级官方(厂商文档)
Gemini 3.1 Pro$2.00$12.001MClosed API多模态、Google 生态官方(厂商文档)
GPT-5.5$5.00$30.00400KClosed APIOpenAI 生态产品官方(厂商文档)
GLM 5.2~$1.40~$4.401MOpen weights (MIT)免费本地开源厂商自报
DeepSeek V4 Pro$0.435$0.871MOpen weights低价强推理厂商自报
DeepSeek V4 Flash$0.14$0.281MOpen weights (MIT)大流量平价场景厂商自报
Qwen 3.8 Max≈$2.00≈$6.001MAnnounced, not released中国 + 价格厂商自报
Kimi K3$3.00$15.001MOpen weights中文 + 开源权重厂商自报

Sonnet 5 为 2026-08-31 前的推广价。Gemini 3.1 Pro 费率适用于 200K token 以内的提示词(超出按更高档);GPT-5.5 费率适用于 272K 以内(超出有长上下文档),另有更便宜的推理模式档位 $1.25/$10。GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max 与 Kimi K3 价格为厂商自报、未经独立核实;Qwen 的 $2/$6 为国际标价估算——见基准表下方说明。来源标注:「官方」= 厂商文档;「厂商自报」= 厂商公告,未经独立核实。

核心基准矩阵 —— 谁测的什么

有公布数字的模型的 agent 编码与知识工作成绩。每个数字都标注来源;任何实验室公布的数字都只作方向性参考。

模型Claude Fable 5Claude Opus 5GPT-5.5GLM 5.2
SWE-Bench Pro(agent 编码)80.3%Not confirmed(截至 2026-08-04)58.6%62.1%
FrontierCode Diamond(高难编码)29.3%无公布成绩5.7%无公布成绩
GDPval-AA(知识工作)1932无公布成绩1769无公布成绩
OSWorld-Verified(计算机操作)85.0%无公布成绩78.7%无公布成绩

来源:Fable 5、Opus 5、Sonnet 5 数字来自 Anthropic 2026 年 6 月 9 日发布公告与模型文档(厂商自报,2026 年 8 月 4 日对照 Anthropic 来源核实)。GPT-5.5 数字来自 OpenAI 发布(厂商自报)。GLM 5.2 的 SWE-Bench Pro 62.1% 与 FrontierSWE 74.4% 出自 GLM 5.2 技术报告(2026 年 6 月,厂商自报);同表 Opus 4.8 与 GPT-5.5 列为 Anthropic / OpenAI 的数字。Gemini 3.1 Pro、DeepSeek V4 Pro、DeepSeek V4 Flash、Qwen 3.8 Max 与 Kimi K3 截至 2026 年 8 月 4 日均无公布 SWE-Bench Pro 成绩——表中如实标注,不猜测。

证据对等性:Fable 5 的 80.3% 与 GPT-5.5 的 58.6% 是全表唯一共享同一 harness 定义与计分协议的两组 SWE-Bench Pro 数字(虽然各自实验室自选设置)。GLM 5.2 的 62.1% 来自不同的 harness 实现,不可直接对比。GDPval-AA 1932(Fable 5)与 1769(GPT-5.5)为 Artificial Analysis 实测(独立)。截至 2026-08-04,除 Fable 5 外没有任何模型有经独立核实的 SWE-Bench Pro 成绩。Fable 5 完整基准集见基准详解页。

选型指南 —— 按预算

你的价格上限决定先从哪款开始。

  • 能付前沿价(输出 $50+/百万)

    最难 agent 任务用 Fable 5($10/$50);默认车道用 Opus 5($5/$25)——公开基准上同一能力区间,且无 30 天留存。这是推荐的 Claude 双层配置。

  • 想要 $15/百万输出以内的靠谱模型

    Sonnet 5($2/$10,2026-08-31 前推广价)、Gemini 3.1 Pro($2/$12,限 200K 内提示词)或 Kimi K3($3/$15)。Sonnet 5 留在 Claude 生态;Gemini 与 K3 分别带来更广的多模态与开源权重选项。

  • 成本敏感或大流量

    GPT-5.5($5/$30,便宜的非推理档 $1.25/$10)、GLM 5.2(Z.ai 约 $1.40/$4.40)、DeepSeek V4 Pro($0.435/$0.87)或 DeepSeek V4 Flash($0.14/$0.28)。Flash 是市面上最便宜的严肃编码模型——输入价约为 Fable 5 的 1/70。

  • 要开源权重或自托管

    GLM 5.2(MIT 许可,Ollama 免费跑)、DeepSeek V4 Pro 与 V4 Flash(Flash 为 MIT),或 Kimi K3(约 1.4 TB 权重,需约 18 张 H100 级显卡——是集群项目,不是笔记本模型)。Qwen 3.8 Max 于 2026 年 8 月 3 日宣布「下周」开源,但尚未发布——not confirmed。

选型指南 —— 按任务类型

诚实的答案几乎总是「两个都用,按任务路由」。以下是分任务判断。

  • Agent 编码、长时自主运行

    Fable 5(SWE-Bench Pro 80.3%)或 Opus 5——公开成绩最高的两款,Opus 5 只需一半价格。GPT-5.5 以 58.6% 落后;GLM 5.2 以 62.1% 胜任中等复杂度单文件工作。

  • 日常与中等复杂度编码

    中档模型都能达标:Sonnet 5、GPT-5.5、GLM 5.2、DeepSeek V4 Pro 或 Flash。按价格与生态选。Fable 5 在这里属于杀鸡用牛刀,溢价很少回本。

  • 长上下文(1M token 窗口)

    Fable 5、Opus 5、Sonnet 5、Gemini 3.1 Pro、GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max 与 Kimi K3 都支持 1M 上下文。GPT-5.5 上限 400K。上下文密集流量按价格选便宜的;需要深度整仓库推理时选 Fable 5。

  • 中文或中国境内托管

    Kimi K3(BenchAlign v5 中文实验室排名第一,中国境内 API)或 Qwen 3.8 Max(阿里云,人民币计费,约 $2/$6)。Fable 5 是受美国出口管制的境外 API——数据必须留在中国时是硬伤。

  • 图像、视频或音频输入

    Gemini 3.1 Pro(MMMU-Pro 第一)多模态栈最全;Qwen 3.8 Max 支持文本、图像与视频。Fable 5 支持图像与 PDF 输入,但媒体密集的工作流不是它的主场。

选型指南 —— 按硬性约束

有些要求在任何基准之前就决定了选择。

  • 必须留在 Anthropic API

    选择在内部:最难 agent 任务用 Fable 5,默认车道用 Opus 5(半价),量大的预算场景用 Sonnet 5。三者共享同一 API 面、缓存与工具链。

  • 要求零数据留存

    Fable 5 的强制 30 天留存(零留存协议不适用)直接出局。Opus 5 与 Sonnet 5 无留存要求;Gemini 3.1 Pro 的数据治理不同,受 Google 条款约束。

  • 需要一个不可能被停服的模型

    Fable 5 曾因美国出口管制指令于 2026 年 6 月 12 日至 7 月 1 日全球停服,理论上可能重演。MIT 许可的开源权重(GLM 5.2、DeepSeek V4 Flash,以及即将开源的 Qwen 3.8 Max)无法被收回——这是国际团队与企业团队的决定性论据。

  • 需要开源权重或自托管

    GLM 5.2(MIT)、DeepSeek V4 Flash(MIT)或 Kimi K3(Modified MIT,条款未完全确认)。Anthropic 没有任何开源模型。Qwen 3.8 Max 权重已宣布但截至 2026-08-04 尚未发布。

  • 活在 Google 或 OpenAI 生态里

    在 Google 栈(Workspace、Vertex、Gemini 应用免费层)选 Gemini 3.1 Pro;在 OpenAI 栈(结构化输出、Assistants)选 GPT-5.5。迁移成本往往大过基准差距。

决策树,浓缩版

三个问题,每个一个答案——然后去读完整对比。

问题一——预算:输出价超过约 $50/百万,就用 Fable 5 或 Opus 5 做升级车道;低于它,从中档(Sonnet 5、Gemini 3.1 Pro、GPT-5.5、Kimi K3)或低档(GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max)开选。问题二——任务:前沿级 agent 编码、长时自主运行、整仓库 1M 分析指向 Fable 5;其余一切指向「最便宜且过质量线」的模型。问题三——约束:必须留在 Anthropic、必须零留存、必须开源权重、必须中国境内托管——任何一条都优先于前两个问题。

放之各矩阵皆准的原则:Fable 5 的溢价只在「便宜模型真的失败、重试(或人工)要花真钱」的工作上才值得。用能成功的最便宜车道,把最难的那 10–20% 升级给 Fable 5。

证据对等性 —— 哪些数字共用同一 harness

这样读表,才不会被不一致的基准误导。

  • 同 harness 对比

    Fable 5(80.3%)与 GPT-5.5(58.6%)是全表唯一共享同一 harness 定义与计分协议的 SWE-Bench Pro 数字——唯一可直接对比的一行(虽为各实验室自选设置)。

  • 经独立测量的数字

    GDPval-AA 1932(Fable 5)与 1769(GPT-5.5)为 Artificial Analysis 实测。Kimi K3 的 DeepSWE 68.5% 对 Fable 5 的 69.9%(Together AI,2026 年 8 月,pass@1)是本清单中唯一的独立正面交锋。其余均为厂商自报。

  • DeepSeek 的说法

    V4 Flash 自报 SWE-Bench Verified 79.0%、LiveCodeBench 91.6(官方技术报告,未经独立核实);7 月 31 日的 agent 能力升级声明也无独立验证。Flash 与 Pro 线均无 SWE-Bench Pro 数字——截至 2026-08-04 not confirmed。

  • Qwen 3.8 Max 的说法

    阿里声称 LMArena 上「仅次于 Fable 5」,并称在 agent 计算机操作上领先(OSWorld-Verified 86.1,厂商自报),但发布时没有模型卡或基准表——截至 2026-08-04 未经证实。

  • Kimi K3 的说法

    Moonshot 自报 DeepSWE 67.5%(max 推理)对 Fable 5 的 70.0%;Together AI 独立实测两者几乎打平(68.5% 对 69.9% pass@1)。K3 无公布 SWE-Bench Pro 成绩。许可条款未完全确认。

用你的负载跑一遍数字

成本计算器目前只建模 Anthropic 自家产品线(Fable 5、Opus 5、Sonnet 5 等),含 effort 档位、缓存与 safeguard 分流。它还不能切换到竞品模型——比价请用上面矩阵的标价,以及各对比页的算例。

还在犹豫?

先读最深的对比——Fable 5 vs Opus 5,决定大多数 Claude 选择的两款模型——或者用成本计算器算你的真实负载。

常见问题