核实日期:2026 年 8 月 4 日
Claude Fable 5 —— 全模型对比总览
一页看清全貌:Claude Fable 5 与 Anthropic 自家产品线、以及 2026 年所有重要竞品的对比——价格、agent 编码、上下文、开源与最佳场景。每个数字都标注日期与来源,并链接到各模型的完整对比页。
结论速览 —— 一句话看懂 Fable 5
Claude Fable 5 是 Anthropic 公开成绩最高的 agent 编码模型——SWE-Bench Pro 80.3%,每百万 token $10/$50——但它已不再是 Claude 的默认模型:自 2026 年 7 月 24 日起,Claude Opus 5 成为 Claude Max 的默认模型,以一半价格($5/$25)匹配 Fable 5 的能力区间,且没有强制数据留存。最难的 agent 任务——长时自主运行、前沿级编码、整仓库 1M 上下文分析——选 Fable 5;其余一切选 Opus 5(或更便宜的竞品)。下表一眼看全九款替代。
最后核实 — 2026-08-04
本页价格与基准数字均于 2026 年 8 月 4 日对照所引来源核实。Anthropic 数据来自 src/lib/model-pricing.ts(对照 Anthropic 定价文档);竞品数据来自本站各对比页(各自注明日期与来源)及下方所列厂商页面。凡无法确认的数字一律标注「not confirmed」并注明日期。
主对比矩阵
API 每百万 token 标价(美元)与决定多数选择的关键事实。完整背景与说明见下文及各对比页。
| 模型 | 输入(每百万) | 输出(每百万) | 上下文 | 开源权重 | 最佳场景 | 来源 |
|---|---|---|---|---|---|---|
| Claude Fable 5 | $10.00 | $50.00 | 1M | Closed API | 前沿 agent 编码 | 官方(厂商文档) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Closed API | 默认车道,无留存 | 官方(厂商文档) |
| Claude Sonnet 5 | $2.00* | $10.00* | 1M | Closed API | 均衡的 Claude 层级 | 官方(厂商文档) |
| Gemini 3.1 Pro | $2.00 | $12.00 | 1M | Closed API | 多模态、Google 生态 | 官方(厂商文档) |
| GPT-5.5 | $5.00 | $30.00 | 400K | Closed API | OpenAI 生态产品 | 官方(厂商文档) |
| GLM 5.2 | ~$1.40 | ~$4.40 | 1M | Open weights (MIT) | 免费本地开源 | 厂商自报 |
| DeepSeek V4 Pro | $0.435 | $0.87 | 1M | Open weights | 低价强推理 | 厂商自报 |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M | Open weights (MIT) | 大流量平价场景 | 厂商自报 |
| Qwen 3.8 Max | ≈$2.00 | ≈$6.00 | 1M | Announced, not released | 中国 + 价格 | 厂商自报 |
| Kimi K3 | $3.00 | $15.00 | 1M | Open weights | 中文 + 开源权重 | 厂商自报 |
Sonnet 5 为 2026-08-31 前的推广价。Gemini 3.1 Pro 费率适用于 200K token 以内的提示词(超出按更高档);GPT-5.5 费率适用于 272K 以内(超出有长上下文档),另有更便宜的推理模式档位 $1.25/$10。GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max 与 Kimi K3 价格为厂商自报、未经独立核实;Qwen 的 $2/$6 为国际标价估算——见基准表下方说明。来源标注:「官方」= 厂商文档;「厂商自报」= 厂商公告,未经独立核实。
核心基准矩阵 —— 谁测的什么
有公布数字的模型的 agent 编码与知识工作成绩。每个数字都标注来源;任何实验室公布的数字都只作方向性参考。
| 模型 | Claude Fable 5 | Claude Opus 5 | GPT-5.5 | GLM 5.2 |
|---|---|---|---|---|
| SWE-Bench Pro(agent 编码) | 80.3% | Not confirmed(截至 2026-08-04) | 58.6% | 62.1% |
| FrontierCode Diamond(高难编码) | 29.3% | 无公布成绩 | 5.7% | 无公布成绩 |
| GDPval-AA(知识工作) | 1932 | 无公布成绩 | 1769 | 无公布成绩 |
| OSWorld-Verified(计算机操作) | 85.0% | 无公布成绩 | 78.7% | 无公布成绩 |
来源:Fable 5、Opus 5、Sonnet 5 数字来自 Anthropic 2026 年 6 月 9 日发布公告与模型文档(厂商自报,2026 年 8 月 4 日对照 Anthropic 来源核实)。GPT-5.5 数字来自 OpenAI 发布(厂商自报)。GLM 5.2 的 SWE-Bench Pro 62.1% 与 FrontierSWE 74.4% 出自 GLM 5.2 技术报告(2026 年 6 月,厂商自报);同表 Opus 4.8 与 GPT-5.5 列为 Anthropic / OpenAI 的数字。Gemini 3.1 Pro、DeepSeek V4 Pro、DeepSeek V4 Flash、Qwen 3.8 Max 与 Kimi K3 截至 2026 年 8 月 4 日均无公布 SWE-Bench Pro 成绩——表中如实标注,不猜测。
证据对等性:Fable 5 的 80.3% 与 GPT-5.5 的 58.6% 是全表唯一共享同一 harness 定义与计分协议的两组 SWE-Bench Pro 数字(虽然各自实验室自选设置)。GLM 5.2 的 62.1% 来自不同的 harness 实现,不可直接对比。GDPval-AA 1932(Fable 5)与 1769(GPT-5.5)为 Artificial Analysis 实测(独立)。截至 2026-08-04,除 Fable 5 外没有任何模型有经独立核实的 SWE-Bench Pro 成绩。Fable 5 完整基准集见基准详解页。
选型指南 —— 按预算
你的价格上限决定先从哪款开始。
能付前沿价(输出 $50+/百万)
最难 agent 任务用 Fable 5($10/$50);默认车道用 Opus 5($5/$25)——公开基准上同一能力区间,且无 30 天留存。这是推荐的 Claude 双层配置。
想要 $15/百万输出以内的靠谱模型
Sonnet 5($2/$10,2026-08-31 前推广价)、Gemini 3.1 Pro($2/$12,限 200K 内提示词)或 Kimi K3($3/$15)。Sonnet 5 留在 Claude 生态;Gemini 与 K3 分别带来更广的多模态与开源权重选项。
成本敏感或大流量
GPT-5.5($5/$30,便宜的非推理档 $1.25/$10)、GLM 5.2(Z.ai 约 $1.40/$4.40)、DeepSeek V4 Pro($0.435/$0.87)或 DeepSeek V4 Flash($0.14/$0.28)。Flash 是市面上最便宜的严肃编码模型——输入价约为 Fable 5 的 1/70。
要开源权重或自托管
GLM 5.2(MIT 许可,Ollama 免费跑)、DeepSeek V4 Pro 与 V4 Flash(Flash 为 MIT),或 Kimi K3(约 1.4 TB 权重,需约 18 张 H100 级显卡——是集群项目,不是笔记本模型)。Qwen 3.8 Max 于 2026 年 8 月 3 日宣布「下周」开源,但尚未发布——not confirmed。
选型指南 —— 按任务类型
诚实的答案几乎总是「两个都用,按任务路由」。以下是分任务判断。
Agent 编码、长时自主运行
Fable 5(SWE-Bench Pro 80.3%)或 Opus 5——公开成绩最高的两款,Opus 5 只需一半价格。GPT-5.5 以 58.6% 落后;GLM 5.2 以 62.1% 胜任中等复杂度单文件工作。
日常与中等复杂度编码
中档模型都能达标:Sonnet 5、GPT-5.5、GLM 5.2、DeepSeek V4 Pro 或 Flash。按价格与生态选。Fable 5 在这里属于杀鸡用牛刀,溢价很少回本。
长上下文(1M token 窗口)
Fable 5、Opus 5、Sonnet 5、Gemini 3.1 Pro、GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max 与 Kimi K3 都支持 1M 上下文。GPT-5.5 上限 400K。上下文密集流量按价格选便宜的;需要深度整仓库推理时选 Fable 5。
中文或中国境内托管
Kimi K3(BenchAlign v5 中文实验室排名第一,中国境内 API)或 Qwen 3.8 Max(阿里云,人民币计费,约 $2/$6)。Fable 5 是受美国出口管制的境外 API——数据必须留在中国时是硬伤。
图像、视频或音频输入
Gemini 3.1 Pro(MMMU-Pro 第一)多模态栈最全;Qwen 3.8 Max 支持文本、图像与视频。Fable 5 支持图像与 PDF 输入,但媒体密集的工作流不是它的主场。
选型指南 —— 按硬性约束
有些要求在任何基准之前就决定了选择。
必须留在 Anthropic API
选择在内部:最难 agent 任务用 Fable 5,默认车道用 Opus 5(半价),量大的预算场景用 Sonnet 5。三者共享同一 API 面、缓存与工具链。
要求零数据留存
Fable 5 的强制 30 天留存(零留存协议不适用)直接出局。Opus 5 与 Sonnet 5 无留存要求;Gemini 3.1 Pro 的数据治理不同,受 Google 条款约束。
需要一个不可能被停服的模型
Fable 5 曾因美国出口管制指令于 2026 年 6 月 12 日至 7 月 1 日全球停服,理论上可能重演。MIT 许可的开源权重(GLM 5.2、DeepSeek V4 Flash,以及即将开源的 Qwen 3.8 Max)无法被收回——这是国际团队与企业团队的决定性论据。
需要开源权重或自托管
GLM 5.2(MIT)、DeepSeek V4 Flash(MIT)或 Kimi K3(Modified MIT,条款未完全确认)。Anthropic 没有任何开源模型。Qwen 3.8 Max 权重已宣布但截至 2026-08-04 尚未发布。
活在 Google 或 OpenAI 生态里
在 Google 栈(Workspace、Vertex、Gemini 应用免费层)选 Gemini 3.1 Pro;在 OpenAI 栈(结构化输出、Assistants)选 GPT-5.5。迁移成本往往大过基准差距。
决策树,浓缩版
三个问题,每个一个答案——然后去读完整对比。
问题一——预算:输出价超过约 $50/百万,就用 Fable 5 或 Opus 5 做升级车道;低于它,从中档(Sonnet 5、Gemini 3.1 Pro、GPT-5.5、Kimi K3)或低档(GLM 5.2、DeepSeek V4 Pro/Flash、Qwen 3.8 Max)开选。问题二——任务:前沿级 agent 编码、长时自主运行、整仓库 1M 分析指向 Fable 5;其余一切指向「最便宜且过质量线」的模型。问题三——约束:必须留在 Anthropic、必须零留存、必须开源权重、必须中国境内托管——任何一条都优先于前两个问题。
放之各矩阵皆准的原则:Fable 5 的溢价只在「便宜模型真的失败、重试(或人工)要花真钱」的工作上才值得。用能成功的最便宜车道,把最难的那 10–20% 升级给 Fable 5。
证据对等性 —— 哪些数字共用同一 harness
这样读表,才不会被不一致的基准误导。
同 harness 对比
Fable 5(80.3%)与 GPT-5.5(58.6%)是全表唯一共享同一 harness 定义与计分协议的 SWE-Bench Pro 数字——唯一可直接对比的一行(虽为各实验室自选设置)。
经独立测量的数字
GDPval-AA 1932(Fable 5)与 1769(GPT-5.5)为 Artificial Analysis 实测。Kimi K3 的 DeepSWE 68.5% 对 Fable 5 的 69.9%(Together AI,2026 年 8 月,pass@1)是本清单中唯一的独立正面交锋。其余均为厂商自报。
DeepSeek 的说法
V4 Flash 自报 SWE-Bench Verified 79.0%、LiveCodeBench 91.6(官方技术报告,未经独立核实);7 月 31 日的 agent 能力升级声明也无独立验证。Flash 与 Pro 线均无 SWE-Bench Pro 数字——截至 2026-08-04 not confirmed。
Qwen 3.8 Max 的说法
阿里声称 LMArena 上「仅次于 Fable 5」,并称在 agent 计算机操作上领先(OSWorld-Verified 86.1,厂商自报),但发布时没有模型卡或基准表——截至 2026-08-04 未经证实。
Kimi K3 的说法
Moonshot 自报 DeepSWE 67.5%(max 推理)对 Fable 5 的 70.0%;Together AI 独立实测两者几乎打平(68.5% 对 69.9% pass@1)。K3 无公布 SWE-Bench Pro 成绩。许可条款未完全确认。