Fable 5.1 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)
Claude Fable 5.1(2026-09-02 发布,SWE-bench 87.7%,$10/$50)对比 DeepSeek V4 Pro 与 V4 Flash 做编程——Agentic 编码质量、开放权重自托管,以及按 5.1 数字更新的「每个已解决问题成本」算法。

已更新至 Fable 5.1(2026-09-02)。 持续维护的旗舰对比见 Claude Fable 5 vs DeepSeek V4 Pro。2026 年 8 月的 Fable 5 vs DeepSeek 编码分析 仍可作为历史参考。
TL;DR(截至 2026-09-04): 就编码而言,Anthropic 发布 Fable 5.1 拉大了质量差距,但没有改变价格差距。Fable 5.1 在 SWE-bench Verified 上 87.7%(Anthropic 官方),DeepSeek V4 Pro 在同一测试名上自称 55.4%——但 V4 Pro 每百万 token $0.435/$0.87,对比 Fable 5.1 的 $10/$50,输入约便宜 23 倍,V4 Flash 更便宜,为 $0.14/$0.28。按「每个已解决问题成本」排名,而不是通过率。 在约 23 倍的输入价差下,DeepSeek 失败很多次才抵得上 Fable 5.1 单次尝试的成本——但 Fable 5.1 每次尝试真正解决问题的概率要高得多。常规与中等复杂度编码,DeepSeek 是理性默认;前沿 Agentic 编码,Fable 5.1 是天花板。动手前用成本计算器算自己的负载。
编码问题,诚实地讲
多数「Fable vs DeepSeek」对比文拿两个模型在一个分数上比,就下结论。用于编码,这会塌掉一个真正的决策。诚实的框架有三部分:
- 基准并不对等。 Fable 5.1 的 87.7% SWE-bench Verified 是 Anthropic 官方发布数据(2026-09-02)。DeepSeek 在同一测试名上的 55.4%,以及 V4 的每一个数字,都来自 DeepSeek 自家技术报告——截至 2026-09-04 无任何独立验证。「未确认」才是对 DeepSeek 各行的准确标签。
- 价差巨大——5.1 没有改变。 Fable 5.1 保持 Fable 5 的 $10/$50 牌价。DeepSeek 约便宜 23 倍的输入不只是省钱——它改变了编码的重试算法。
- 任务层级决定赢家。 常规/中等复杂度编码与前沿 Agentic 编码是不同的问题,两个模型在各自层级的排名不同。
模型并排对比
| 规格 | Claude Fable 5.1 | DeepSeek V4 Pro | DeepSeek V4 Flash |
|---|---|---|---|
| 厂商 | Anthropic | DeepSeek | DeepSeek |
| 发布 | 2026 年 9 月 2 日 | 2026(V4 系列) | 2026(V4 系列) |
| 定位 | Mythos 级旗舰(更新版) | 开源权重前沿挑战者 | 预算档开源权重 |
| 输入 / 输出价格(每 M token) | $10 / $50 | $0.435 / $0.87 | $0.14 / $0.28 |
| 缓存命中输入(每 M token) | $1 | $0.003625 | ~$0.0012 |
| 上下文窗口 | 1M | 1M | 1M |
| SWE-bench Verified(Agentic 编码) | 87.7%(官方) | 55.4%(自报) | 未公布 |
| 许可 | 闭源,仅 API | MIT 开源权重 | MIT 开源权重 |
| 数据留存 | 强制 30 天 | 你的策略(API)/ 完全自有(自托管) | 同 V4 Pro |
| 出口管制风险 | 已证实——6 月 12 日至 7 月 1 日停用 19 天 | 无——权重无法被收回 | 无 |
价格核实于 2026-09-04:Anthropic 费率见模型定价;DeepSeek 费率见官方 API 文档。
编码基准:公布了什么,谁公布的
| 基准 | Fable 5.1 | V4 Pro | V4 Flash | 来源 |
|---|---|---|---|---|
| SWE-bench Verified | 87.7% | 55.4%(同名测试) | 未公布 | 5.1:Anthropic 官方。V4 Pro:DeepSeek 技术报告(自报) |
| SWE-Bench Verified(DeepSeek harness) | 未公布 | 80.6% | 未公布 | DeepSeek 技术报告(自报) |
| LiveCodeBench | 未公布 | 93.5 | 未公布 | DeepSeek 技术报告(自报) |
| Codeforces(rating) | 未公布 | 3206 | 未公布 | DeepSeek 技术报告(自报) |
| Terminal-Bench 2.0 | 未公布 | 67.9% | 未公布 | DeepSeek 技术报告(自报) |
| FrontierMath | 38.2% | 未公布 | 未公布 | Anthropic 官方 |
引用前请注意三点:
- 唯一的「重叠」是陷阱。 两者在类似 SWE-bench 名称下都有数字(87.7% vs 55.4%),但 V4 Pro 的是 DeepSeek 自家 harness 跑分,零第三方复现。SWE-Bench Verified 与 Pro 是不同测试集——不要把 V4 Pro 的 80.6% 与 Fable 5.1 的 87.7% 直接比。
- V4 Pro 的数字来自最高推理档(「Thinking Max」)。默认或更低 effort 预期更低。
- DeepSeek 自己说 V4 比前沿模型落后约 3–6 个月。 Fable 5.1 在 Agentic 编码上拉大了差距,但没有抹平 DeepSeek 的价格优势。
每个已解决问题成本:扭转通过率之争的地方
通过率差距看起来 decisively 偏向 Fable 5.1。成本比较却反转结论。以下是按 5.1 更新的算法。
取一个有代表性的编码 agent 任务:60,000 输入 token(代码库上下文 + 指令)和 2,000 输出 token(补丁),输入 80% 命中 prompt 缓存。
| 任务 | Claude Fable 5.1 | DeepSeek V4 Pro |
|---|---|---|
| 每次尝试输入(60K,80% 缓存) | ≈ $0.13 | ≈ $0.0050 |
| 每次尝试输出(2K) | $0.10 | $0.0017 |
| 每次尝试成本 | ≈ $0.23 | ≈ $0.0067 |
DeepSeek 每次尝试约便宜 34 倍。再乘上解决率:
- 每个已解决问题(Fable 5.1,87.7%): ≈ $0.23 / 0.877 ≈ $0.26
- 每个已解决问题(Fable 5,80.3%——旧版): ≈ $0.23 / 0.803 ≈ $0.29
- 每个已解决问题(V4 Pro,55%): ≈ $0.0067 / 0.55 ≈ $0.012
Fable 5.1 更高的解决率把每个已解决问题账单砍掉约 $0.03——有意义,但填不满 V4 Pro 真能解决的任务层级里相对 DeepSeek 约 20 倍的差距。DeepSeek 的经济性如此倾斜,决策不是「哪个模型更聪明」,而是**「这个任务在我的便宜可解层级里吗?」**:
- 常规与中等复杂度编码——样板、重构、片段、范围明确的 ticket——几乎总在便宜档。DeepSeek 每个已解决问题成本低约 20 倍,基准差距挡不住。
- 前沿 Agentic 编码——多文件交叉重构、长自主运行——重试算法会反转。任务落在便宜模型能力边缘时,失败尝试不再免费,一次 Fable 5.1 成功反而更便宜也更快。
用成本计算器算自己的数字。Fable 5.1 侧还有强制 30 天数据留存和 safeguard fallback,值得计入账单。
编码场景各自赢在哪里
选 Fable 5.1 当:
- 任务 Agentic 且长。 多文件、多步骤、自主工作——正是 87.7% vs 自报更低分的差距所在。
- 架构决策重要。 影响全代码库的决策需要最高天花板,不是最便宜重试。
- 需要上下文与记忆。 1M 上下文 + 文件记忆;V4 Pro 也是 1M,但该规模下的耐力未验证。
选 DeepSeek(V4 Pro / V4 Flash)当:
- 流量主导。 样板、测试、文档、范围明确的 ticket——两者都过质量门槛就上便宜档。
- 要自托管。 MIT 权重,你的 GPU,代码不出你的基础设施。
- 连续性不可妥协。 开源权重不会被出口管制关掉。
监管与所有权背景
两条与基准无关的事实,往往比分数更影响编码决策:
- Fable 5.1 强制 30 天数据留存。 严格数据 residency 或零留存合规的代码库,这是 blocker,与质量无关。
- 出口管制是已证实的风险类别。 Fable 5 曾于 2026 年 6 月全球停用 19 天。CI/CD 不能容忍模型被关,这是开源权重最强的论据。
独立分析,截至 2026-09-04。DeepSeek 基准数字均为厂商自报,发布时未经第三方验证。参见旗舰对比、预算档对比、DeepSeek Harness 插件指南、Fable 5.1 发布基准,并用成本计算器算自己的负载。