核实日期:2026 年 8 月 4 日

Claude Fable 5 对比 Gemini 3.1 Pro

2026 年定位最好的两个前沿模型走的是相反的取舍:Fable 5 以高价拿下 agent 编码基准的领先位置,Gemini 3.1 Pro 以 4–5 倍的价格优势贴身肉搏,还自带 Google 生态。这里按任务给出结论,每个数字都有来源和日期。

结论速览 —— 谁该选谁

按任务来选:Agent 编码和长时自主运行选 Fable 5——它的公开成绩最高(SWE-Bench Pro 80.3% 对 54.2%),而且这正是它的设计目标。多模态、图像、视频和 Google 生态集成选 Gemini 3.1 Pro。长上下文两者都是 1M 窗口,Gemini 更便宜。成本敏感的大流量场景选 Gemini——标价便宜约 4–5 倍,Gemini 应用还有免费层。没有唯一正确答案,按任务路由即可。详见下文。

最后核实

本页所有价格、规格与基准数字均于 2026 年 8 月 4 日对照所引来源核实。Gemini 3.1 Pro 仍是预览版模型,Google 会调整定价;凡无法确认的数字一律标注「not confirmed」并注明日期。

规格与定价对照

API 每百万 token 标价,美元。Fable 5 数据来自 Anthropic 定价文档(2026 年 7 月 27 日核实);Gemini 数据来自 Google API 定价(2026 年 8 月 4 日核实)。Gemini 的费率适用于 200K token 以内的提示词,超出部分按更高档计费。

Claude Fable 5Gemini 3.1 Pro
发布时间2026-06-092026-02-19
模型 IDclaude-fable-5gemini-3.1-pro-preview
状态GAPreview
输入(每百万 token)$10.00$2.00
输出(每百万 token)$50.00$12.00
缓存命中输入$1.00$0.20
批量(五折)$5.00 / $25.00$1.00 / $6.00
上下文窗口1M1M
最大输出128K64K
多模态输入Image, PDFImage, video, audio
数据留存30 days, mandatoryNone
消费端套餐Max / Team PremiumGoogle AI Pro $19.99/mo
开源权重NoNo

Gemini 3.1 Pro 为预览版模型;超过 200K token 的提示词按 $4/$18 计费(来源:Google API 文档,2026 年 8 月 4 日)。最大输出取自 Google 模型参考(65,536 = 64K)。Fable 5 最大输出为 128K,据 Anthropic 文档。

基准矩阵 —— 附来源标注

每个分数都标注了出处。Anthropic 与 Google 各自公布自家模型的结果,独立测试会单独标出。任何厂商公布的数字都只能作为方向性参考。

  • SWE-Bench Pro —— agent 编码

    Fable 5:80.3% · Gemini 3.1 Pro:54.2%(Google 未公布 3.1 Pro 的成绩,此数为旧版 Gemini 3 Pro 预览版)。来源:Anthropic 2026 年 6 月 9 日发布公告的两组数字——厂商自报,测试设置不同。

  • FrontierCode(Diamond)—— 高难编码

    Fable 5:29.3% · Gemini 3.1 Pro:无公布成绩。来源:Anthropic,2026 年 6 月 9 日——厂商自报;Google 没有公布可比的 FrontierCode 结果,这是「没有证据」而非 Gemini 失败。

  • GDPval-AA —— agent 知识工作

    Fable 5:1932 · Gemini 3.1 Pro:1316(Artificial Analysis 实测,2026 年 2 月——独立测试)。3.1 Pro 比 Gemini 3 Pro 预览版提升了约 100 分,但仍落后 Fable 5 与 Opus 5。

  • GDP.pdf —— 密集文档与视觉

    Fable 5:29.8% · Gemini 3.1 Pro:16.7%。来源:Anthropic 6 月 9 日公告(厂商自报);Gemini 数字来自旧版 3 Pro 预览版。对 Gemini 3.1 Pro 文档推理的独立测试显示其实际能力强于 16.7% 所暗示的水平。

  • OSWorld-Verified —— 计算机操作

    Fable 5:85.0% · Gemini 3.1 Pro:76.2%。来源:Anthropic 6 月 9 日公告——厂商自报,Gemini 数字来自 3 Pro 预览版。针对 Gemini 3.1 Pro 的独立计算机操作测试尚未公布。

  • 多模态与推理(MMMU-Pro)

    Gemini 3.1 Pro 在 MMMU-Pro 上排名第一(Artificial Analysis 智能指数,2026 年 2 月——独立测试)。Fable 5 的多模态成绩已公布但不可直接对比。图像、视频、音频输入方面,Gemini 的多模态栈明显更强。

  • AA-Omniscience —— 幻觉率

    Gemini 3.1 Pro 把幻觉率从 88% 降到 50%(Artificial Analysis,2026 年 2 月——独立测试;准确率 53%)。Fable 5 没有可直接对比的公布数据。

来源:Anthropic「Claude Fable 5」公告(2026 年 6 月 9 日);Google Gemini 3.1 Pro 发布(2026 年 2 月 19 日);Artificial Analysis 智能指数(2026 年 2 月);Google 模型参考(2026 年 8 月 4 日)。「独立」指由 Artificial Analysis 等第三方而非厂商运行。

Fable 5 的独有角度:你看不到的安全护栏

三件基准测试展示不了、却把 Fable 5 与 Gemini 3.1 Pro 区分开的事——外加一个只适用于 Fable 5 的出口管制风险。

  • Safeguard 分流与 Mythos

    Fable 5 运行安全分类器,被标记的对话会转由 Opus 4.8 处理——平均不到 5% 的对话(Anthropic)。无限制请求则由同一模型以 Mythos 5 的名义发布,仅限通过审核的机构使用。Gemini 没有这种双版本拆分。

  • 30 天数据留存

    Fable 5 有强制的 30 天留存窗口,零留存协议不适用。Gemini 3.1 Pro 没有对等的留存要求;Google 的数据治理选项不同,受其自身条款约束。

  • 出口管制

    Fable 5 曾因美国出口管制指令于 2026 年 6 月 12 日至 7 月 1 日全球停服,随后恢复,理论上存在再次停服的可能。Gemini 3.1 Pro 没有类似历史。如果「持续可用」是你的硬性要求,这个不对称就是 Fable 5 的真实风险因素。

决策矩阵 —— 如果你是…

诚实的答案几乎总是「两个都用,按任务路由」。以下是分场景的判断。

  • 你在做编码 agent

    选 Fable 5。公开差距是 SWE-Bench Pro 上的 26 分,而数小时长的自主运行正是 Fable 5 的设计目标。预算受限时,日常步骤用 Gemini,把最难的 10–20% 升级给 Fable 5。

  • 你需要图像、视频或音频

    选 Gemini 3.1 Pro。它在 MMMU-Pro 排名第一,原生多模态栈更全面。Fable 5 也支持图像输入,但媒体密集的工作流默认选 Gemini 更稳。

  • 你在处理长上下文

    两者都支持 1M token。上下文密集的流量 Gemini 便宜得多,但要注意阶梯定价——超过 200K token 的提示词按 $4/$18 计费。Fable 5 的 $10/$50 平定价更容易预算。

  • 你对成本敏感或流量很大

    毫无疑问选 Gemini 3.1 Pro——标价便宜约 4–5 倍,消费端 Gemini 应用有免费层,$19.99/月的 Google AI Pro 给完整权限。Fable 5 走 Claude Max(每周限额的至多 50% 内包含)只有在本来就用 Claude 套餐时才划算。

  • 你在受监管行业

    取决于约束是什么。需要敏感领域不受限能力时,只有 Mythos 5(审核制准入)能提供,Gemini 没有对等项目;反过来,如果「不能有数据留存义务」才是硬约束,Fable 5 的强制 30 天留存就是问题,这时 Gemini 胜出。

成本算例 —— 自己算一下

按标价(每百万 token)估算的代表性工作负载。Fable 5 假设 high effort、无缓存、无分流;Gemini 假设标准模式、无缓存、提示词不超过 200K token。实际账单会有差异——用我们的成本计算器跑你的真实负载。

负载 A(编码 agent,输入 1M / 输出 200K):Fable 5 约 $20.00,Gemini 3.1 Pro 约 $4.40——相差约 4.5 倍。负载 B(长上下文 RAG,输入 10M / 输出 100K,带缓存):Fable 5 约 $20.00,Gemini 约 $2.75——相差约 7 倍,缓存命中率 80% 时缩小到约 3 倍。负载 C(多模态,输入 2M / 输出 100K):Fable 5 约 $25.00,Gemini 约 $5.20。凡是两个模型都能做的负载,价格差就是全部故事。

在双方都能胜任的工作上,基准领先撑不过价格差。经验法则:能接受 Gemini 质量门槛的话,便宜 4–5 倍的模型在流量上必然胜出;在「单任务解决成本」重于「每 token 成本」的场景——高难编码、长时 agent 运行、重试敏感的工作——才用 Fable 5。

试试成本计算器

还在犹豫?

用成本计算器跑一遍你的真实负载,或者看看 Fable 5 在 Anthropic 自家产品线里的位置。

常见问题