返回博客

Fable 5.1 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)

Claude Fable 5.1(2026-09-02 发布,SWE-bench 87.7%,$10/$50)对比 DeepSeek V4 Pro 与 V4 Flash 做编程——Agentic 编码质量、开放权重自托管,以及按 5.1 数字更新的「每个已解决问题成本」算法。

2026年9月4日Fable5 编辑部Fable5 编辑部
Fable 5.1 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)

已更新至 Fable 5.1(2026-09-02)。 持续维护的旗舰对比见 Claude Fable 5 vs DeepSeek V4 Pro2026 年 8 月的 Fable 5 vs DeepSeek 编码分析 仍可作为历史参考。

TL;DR(截至 2026-09-04):编码而言,Anthropic 发布 Fable 5.1 拉大了质量差距,但没有改变价格差距。Fable 5.1 在 SWE-bench Verified 上 87.7%(Anthropic 官方),DeepSeek V4 Pro 在同一测试名上自称 55.4%——但 V4 Pro 每百万 token $0.435/$0.87,对比 Fable 5.1 的 $10/$50,输入约便宜 23 倍,V4 Flash 更便宜,为 $0.14/$0.28按「每个已解决问题成本」排名,而不是通过率。 在约 23 倍的输入价差下,DeepSeek 失败很多次才抵得上 Fable 5.1 单次尝试的成本——但 Fable 5.1 每次尝试真正解决问题的概率要高得多。常规与中等复杂度编码,DeepSeek 是理性默认;前沿 Agentic 编码,Fable 5.1 是天花板。动手前用成本计算器算自己的负载。

编码问题,诚实地讲

多数「Fable vs DeepSeek」对比文拿两个模型在一个分数上比,就下结论。用于编码,这会塌掉一个真正的决策。诚实的框架有三部分:

  1. 基准并不对等。 Fable 5.1 的 87.7% SWE-bench Verified 是 Anthropic 官方发布数据(2026-09-02)。DeepSeek 在同一测试名上的 55.4%,以及 V4 的每一个数字,都来自 DeepSeek 自家技术报告——截至 2026-09-04 无任何独立验证。「未确认」才是对 DeepSeek 各行的准确标签。
  2. 价差巨大——5.1 没有改变。 Fable 5.1 保持 Fable 5 的 $10/$50 牌价。DeepSeek 约便宜 23 倍的输入不只是省钱——它改变了编码的重试算法
  3. 任务层级决定赢家。 常规/中等复杂度编码与前沿 Agentic 编码是不同的问题,两个模型在各自层级的排名不同。

模型并排对比

规格Claude Fable 5.1DeepSeek V4 ProDeepSeek V4 Flash
厂商AnthropicDeepSeekDeepSeek
发布2026 年 9 月 2 日2026(V4 系列)2026(V4 系列)
定位Mythos 级旗舰(更新版)开源权重前沿挑战者预算档开源权重
输入 / 输出价格(每 M token)$10 / $50$0.435 / $0.87$0.14 / $0.28
缓存命中输入(每 M token)$1$0.003625~$0.0012
上下文窗口1M1M1M
SWE-bench Verified(Agentic 编码)87.7%(官方)55.4%(自报)未公布
许可闭源,仅 APIMIT 开源权重MIT 开源权重
数据留存强制 30 天你的策略(API)/ 完全自有(自托管)同 V4 Pro
出口管制风险已证实——6 月 12 日至 7 月 1 日停用 19 天无——权重无法被收回

价格核实于 2026-09-04:Anthropic 费率见模型定价;DeepSeek 费率见官方 API 文档

编码基准:公布了什么,谁公布的

基准Fable 5.1V4 ProV4 Flash来源
SWE-bench Verified87.7%55.4%(同名测试)未公布5.1:Anthropic 官方。V4 Pro:DeepSeek 技术报告(自报)
SWE-Bench Verified(DeepSeek harness)未公布80.6%未公布DeepSeek 技术报告(自报)
LiveCodeBench未公布93.5未公布DeepSeek 技术报告(自报)
Codeforces(rating)未公布3206未公布DeepSeek 技术报告(自报)
Terminal-Bench 2.0未公布67.9%未公布DeepSeek 技术报告(自报)
FrontierMath38.2%未公布未公布Anthropic 官方

引用前请注意三点:

  • 唯一的「重叠」是陷阱。 两者在类似 SWE-bench 名称下都有数字(87.7% vs 55.4%),但 V4 Pro 的是 DeepSeek 自家 harness 跑分,零第三方复现。SWE-Bench VerifiedPro 是不同测试集——不要把 V4 Pro 的 80.6% 与 Fable 5.1 的 87.7% 直接比。
  • V4 Pro 的数字来自最高推理档(「Thinking Max」)。默认或更低 effort 预期更低。
  • DeepSeek 自己说 V4 比前沿模型落后约 3–6 个月。 Fable 5.1 在 Agentic 编码上拉大了差距,但没有抹平 DeepSeek 的价格优势。

每个已解决问题成本:扭转通过率之争的地方

通过率差距看起来 decisively 偏向 Fable 5.1。成本比较却反转结论。以下是按 5.1 更新的算法。

取一个有代表性的编码 agent 任务:60,000 输入 token(代码库上下文 + 指令)和 2,000 输出 token(补丁),输入 80% 命中 prompt 缓存。

任务Claude Fable 5.1DeepSeek V4 Pro
每次尝试输入(60K,80% 缓存)≈ $0.13≈ $0.0050
每次尝试输出(2K)$0.10$0.0017
每次尝试成本≈ $0.23≈ $0.0067

DeepSeek 每次尝试约便宜 34 倍。再乘上解决率:

  • 每个已解决问题(Fable 5.1,87.7%): ≈ $0.23 / 0.877 ≈ $0.26
  • 每个已解决问题(Fable 5,80.3%——旧版): ≈ $0.23 / 0.803 ≈ $0.29
  • 每个已解决问题(V4 Pro,55%): ≈ $0.0067 / 0.55 ≈ $0.012

Fable 5.1 更高的解决率把每个已解决问题账单砍掉约 $0.03——有意义,但填不满 V4 Pro 真能解决的任务层级里相对 DeepSeek 约 20 倍的差距。DeepSeek 的经济性如此倾斜,决策不是「哪个模型更聪明」,而是**「这个任务在我的便宜可解层级里吗?」**:

  • 常规与中等复杂度编码——样板、重构、片段、范围明确的 ticket——几乎总在便宜档。DeepSeek 每个已解决问题成本低约 20 倍,基准差距挡不住。
  • 前沿 Agentic 编码——多文件交叉重构、长自主运行——重试算法会反转。任务落在便宜模型能力边缘时,失败尝试不再免费,一次 Fable 5.1 成功反而更便宜也更快。

成本计算器算自己的数字。Fable 5.1 侧还有强制 30 天数据留存和 safeguard fallback,值得计入账单。

编码场景各自赢在哪里

选 Fable 5.1 当:

  1. 任务 Agentic 且长。 多文件、多步骤、自主工作——正是 87.7% vs 自报更低分的差距所在。
  2. 架构决策重要。 影响全代码库的决策需要最高天花板,不是最便宜重试。
  3. 需要上下文与记忆。 1M 上下文 + 文件记忆;V4 Pro 也是 1M,但该规模下的耐力未验证。

选 DeepSeek(V4 Pro / V4 Flash)当:

  1. 流量主导。 样板、测试、文档、范围明确的 ticket——两者都过质量门槛就上便宜档。
  2. 要自托管。 MIT 权重,你的 GPU,代码不出你的基础设施。
  3. 连续性不可妥协。 开源权重不会被出口管制关掉。

监管与所有权背景

两条与基准无关的事实,往往比分数更影响编码决策:

  • Fable 5.1 强制 30 天数据留存。 严格数据 residency 或零留存合规的代码库,这是 blocker,与质量无关。
  • 出口管制是已证实的风险类别。 Fable 5 曾于 2026 年 6 月全球停用 19 天。CI/CD 不能容忍模型被关,这是开源权重最强的论据。

独立分析,截至 2026-09-04。DeepSeek 基准数字均为厂商自报,发布时未经第三方验证。参见旗舰对比预算档对比DeepSeek Harness 插件指南Fable 5.1 发布基准,并用成本计算器算自己的负载。

相关文章