返回博客

Claude Fable5 对比 Gemini 3.1 Pro——基准、价格与选型结论

Fable5 在 SWE-Bench Pro 上领先 Gemini 3.1 Pro 26 个百分点,但价格约为后者 4 倍。两个模型各自赢在哪里、基准表隐藏了什么、按任务类型给出的路由结论。

2026年6月10日Fable5 编辑部Fable5 编辑部
Claude Fable5 对比 Gemini 3.1 Pro——基准、价格与选型结论

本文是发布周的带日期分析。 持续更新、带来源标注的基准与最新价格请见 Claude Fable 5 对比 Gemini 3.1 Pro 页面。

诚实版的对比要从一句多数发布周文章都跳过的免责声明开始:跨厂商基准是厂商自己跑的,设置由他们自己选。把这一点摆上桌面之后——Claude Fable5 与 Gemini 3.1 Pro 之间公布的差距大得反常,而且根据你买的是什么,差距指向完全不同的方向。

基准表,附诚实脚注

基准Fable5Gemini 3.1 Pro
SWE-Bench Pro(agent 编码)80.3%54.2%
FrontierCode(Diamond)29.3%—(未公布)
GDPval-AA(知识工作)19321314
GDP.pdf(视觉、无工具)29.8%16.7%
OSWorld-Verified(计算机使用)85.0%76.2%

两条被发布文章埋掉的脚注。第一,在网络安全和生物学评测上,Fable5 的安全护栏把分数压到接近 Opus 4.8——那些领域的头条高分属于受限的 Mythos 5。第二,Gemini 缺失的 FrontierCode 成绩未必说明问题——Google 只是没公布——但你能拿到的就只有"没有证据"。

价格:差距朝另一个方向跑

  • Fable5: 每百万 token 输入 $10 / 输出 $50。prompt caching 对缓存输入打 1 折;Batch API 全场 5 折。
  • Gemini 3.1 Pro: 约输入 $2 / 输出 $12(提示词 ≤200K token;长上下文更贵)。有上下文缓存折扣。

按标价算,Gemini 3.1 Pro 便宜约 4–5 倍。对大流量生产任务——摘要、抽取、对话——这个倍数就是全部结论:在两个模型都能胜任的工作上,没有任何基准优势扛得住 5 倍价差。用成本计算器算算你自己的负载。

两个模型各自真正赢在哪

路由给 Fable5,当:

  1. 任务是长程 agent 型。 26 个百分点的 SWE-Bench Pro 差距在数小时自主运行中还会拉大——这正是 Fable5 为之设计的负载。
  2. 重试才是真实成本。 最难的问题上,"每解决一个任务的成本"比"每 token 成本"重要,便宜模型的失败尝试并不免费。赢过 Opus 4.8 的那套重试数学在 5 倍价差下同样成立——前提是便宜模型真的解不出来。
  3. 文档又密又依赖视觉。 GDP.pdf(无工具视觉)29.8% 对 16.7%,是这张表里安静的头条。

路由给 Gemini 3.1 Pro,当:

  1. 流量是主导因素。 两个模型都过质量线的生产流量,归便宜的那个,没有讨论余地。
  2. 你生活在 Google 技术栈里。 与 Workspace、Vertex AI 流水线、Google 检索 grounding 工具的原生集成,有基准捕捉不到的真实工作流价值。
  3. 延迟是产品功能。 Fable5 高 effort 思考时间长;交互式产品常常等不起。

没人提的 prompt 差异

Fable5 彻底移除了 temperature 和 top_p——输出风格由 prompt 和 effort 参数控制。Gemini 保留了经典采样参数。实际后果:从 Gemini 移植到 Fable5 的 prompt 应删掉依赖采样的技巧,把想要的变化显式写出来。prompt 生成器直接生成 Fable5 原生 prompt;其余迁移细节见迁移笔记

结论

按任务定,不按模型定:

  • 最难编码、长 agent 运行、密集文档视觉 → Fable5
  • 大流量生产、Google 栈集成、延迟敏感的体验 → Gemini 3.1 Pro
  • 混合负载 → Gemini(或 Opus 5)做默认通道,Fable5 做升级通道,留给那值得的 10–20% 任务。估算分流成本

FAQ

Fable5 比 Gemini 3.1 Pro 强吗? 按已公布基准强——SWE-Bench Pro 领先 26 个百分点,GDPval-AA 领先 618 分。价格和延迟上 Gemini 以相近的幅度反超。

这个对比公平吗? 当方向性参考。厂商自测、设置不同,且 Gemini 没有可对比的 FrontierCode 成绩。

能两个都用吗? 这正是推荐模式:便宜默认通道 + 昂贵升级通道 + 显式路由规则。两家 API 都兼容 OpenRouter,想要单一接入面也可以。

基准数字来自 Anthropic 2026 年 6 月 9 日公告及 Google 已公布的 Gemini 3.1 Pro 成绩,截至 2026 年 6 月 10 日。独立分析——另见完整 Fable5 指南

相关文章