Fable 5 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)
2026 年 8 月的 Claude Fable 5 vs DeepSeek V4 Pro 与 V4 Flash 做编程工作:Agentic 编码质量、开放权重自托管、出口管制背景,以及扭转通过率之争的「每个已解决问题成本」算法。

TL;DR(截至 2026-08-05): 就编码而言,通过率差距是真的,价格差距也是真的。Fable 5 在 SWE-Bench Pro 上 80.3%(Anthropic 官方),DeepSeek V4 Pro 在同一测试名上自称 55.4%——但 V4 Pro 每百万 token $0.435/$0.87,对比 Fable 5 的 $10/$50,输入约便宜 23 倍,V4 Flash 更便宜,为 $0.14/$0.28。这改变了你评估它们的方式:按「每个已解决问题成本」排名,而不是通过率。 在约 23 倍的输入价差下,DeepSeek 失败很多次才抵得上 Fable 5 单次尝试的成本——但 Fable 5 每次尝试真正解决问题的概率要高得多。常规与中等复杂度编码,DeepSeek 是理性默认;前沿 Agentic 编码,Fable 5 是天花板。动手前用成本计算器算自己的负载。
编码问题,诚实地讲
多数「Fable 5 vs DeepSeek」对比文拿两个模型在一个分数上比,就下结论。用于编码,这会塌掉一个真正的决策。诚实的框架有三部分:
- 基准并不对等。 Fable 5 的 80.3% SWE-Bench Pro 是 Anthropic 官方发布数据。DeepSeek 在同一测试名上的 55.4%,以及 V4 的每一个数字,都来自 DeepSeek 自家技术报告——截至 2026-08-05 无任何独立验证。「未确认」才是对 DeepSeek 各行的准确标签。
- 价差巨大。 DeepSeek 约便宜 23 倍的输入不只是省钱——它改变了编码的重试算法。
- 任务层级决定赢家。 常规/中等复杂度编码与前沿 Agentic 编码是不同的问题,两个模型在各自层级的排名不同。
模型并排对比
| 规格 | Claude Fable 5 | DeepSeek V4 Pro | DeepSeek V4 Flash |
|---|---|---|---|
| 厂商 | Anthropic | DeepSeek | DeepSeek |
| 定位 | Mythos 级旗舰 | 开放权重前沿挑战者 | 预算开放权重档 |
| 输入/输出价格(每百万 token) | $10 / $50 | $0.435 / $0.87 | $0.14 / $0.28 |
| 缓存命中输入(每百万 token) | $1 | $0.003625 | ≈$0.0012 |
| 上下文窗口 | 1M | 1M | 1M |
| SWE-Bench Pro(Agentic 编码) | 80.3%(官方) | 55.4%(自报) | 未公布 |
| 许可 | 闭源,仅 API | MIT 开放权重 | MIT 开放权重 |
| 数据留存 | 强制 30 天 | 你的策略(API)/ 完全自控(自托管) | 与 V4 Pro 相同 |
| 出口管制风险 | 已证实——6 月 12 日至 7 月 1 日停用 19 天 | 无——权重无法被收回 | 无 |
价格核实于 2026-08-05:Anthropic 价格见模型定价页,DeepSeek 价格见官方 API 文档。V4 Flash 的缓存价格为按公布费率估算;DeepSeek 已宣布未来将实行 2 倍高峰时段加价(北京时间 09:00–12:00 与 14:00–18:00),生效日期未定。
编码基准:发布了什么、由谁发布
| 基准 | Fable 5 | V4 Pro | V4 Flash | 来源 |
|---|---|---|---|---|
| SWE-Bench Pro | 80.3% | 55.4% | 未公布 | Fable 5:Anthropic 官方。V4 Pro:DeepSeek 技术报告(自报) |
| SWE-Bench Verified | 未公布 | 80.6% | 未公布 | DeepSeek 技术报告(自报) |
| LiveCodeBench | 未公布 | 93.5 | 未公布 | DeepSeek 技术报告(自报) |
| Codeforces(评级) | 未公布 | 3206 | 未公布 | DeepSeek 技术报告(自报) |
| Terminal-Bench 2.0 | 未公布 | 67.9% | 未公布 | DeepSeek 技术报告(自报) |
| FrontierCode(Diamond) | 29.3% | 未公布 | 未公布 | Anthropic 官方 |
引用任何数字前请记住三条:
- 唯一的「重合项」是个陷阱。 两家都公布「SWE-Bench Pro」(80.3% vs 55.4%),但 V4 Pro 的数字是 DeepSeek 自己跑的分,零第三方复现。测试同名,可信度不同。SWE-Bench Verified 与 Pro 是不同测试集——不要拿 V4 Pro 的 80.6% 去和 Fable 5 的 80.3% 直接比。
- V4 Pro 的数字来自最高推理档(「Thinking Max」)。默认或低档预期要打折。
- DeepSeek 自己说 V4 落后前沿模型约 3–6 个月。 这是厂商自己的坦诚,也与下面的「日常 vs 前沿」分野一致。
每个已解决问题成本:通过率之争如何反转
通过率差距看起来对 Fable 5 一边倒。但成本对比反转了结论。以下是算法。
以一个代表性编码 Agent 任务为例:60,000 token 输入(代码库上下文 + 指令)、2,000 token 输出(补丁),输入侧提示词缓存命中率 80%。
| 任务 | Claude Fable 5 | DeepSeek V4 Pro |
|---|---|---|
| 每次尝试输入(60K,80% 缓存) | ≈ $0.13 | ≈ $0.0050 |
| 每次尝试输出(2K) | $0.10 | $0.0017 |
| 每次尝试成本 | ≈ $0.23 | ≈ $0.0067 |
DeepSeek 的每次尝试便宜 约 34 倍。具体地说,V4 Pro 可以失败三十多次,才花掉 Fable 5 单次尝试的成本。现在把解决率算进去:
- 每个已解决问题(Fable 5): ≈ $0.23 / 0.80 ≈ $0.29
- 每个已解决问题(V4 Pro,55%): ≈ $0.0067 / 0.55 ≈ $0.012
即便 V4 Pro 的解决率只有 Fable 5 的一半,它在真正能解决的层级上,每个已解决问题的成本仍约低 20 倍。DeepSeek 的经济性如此一边倒,决策不再是「哪个模型更聪明」,而是**「这个任务在我便宜可解的层级里吗?」**:
- 常规与中等复杂度编码——绝大多数样板、重构、代码片段、边界清晰的工单——几乎总该归入便宜档。无论蓝筹基准差距多大,DeepSeek 约 20 倍更低的每个已解决问题成本都胜出。
- 前沿 Agentic 编码——跨文件横切重构、长链路自主运行、会级联的架构决策——重试算法在这里反过来。如果一个任务接近便宜模型的能力边缘,它的失败尝试就不再免费,一次能解决它的 Fable 5 通过反而成为更便宜也更快的路径。这正是「更贵的模型可能更便宜」的论点,在约 23 倍输入价差下更有力——前提是便宜模型确实解不了。
用成本计算器算自己的数字。Fable 5 一侧还带有强制 30 天数据留存,以及如果代码涉及网络或生物领域值得计入的安全闸门回退项。
编码上各自胜出的地方
以下情况路由到 Fable 5:
- 任务 Agentic 且长链路。 多文件、多步骤、自主的工作正是基准表所讲的那个差距。
- 架构决策要紧。 会像涟漪一样波及整个代码库的决策,奖励的是天花板最高的模型,而不是最便宜的重试。
- 你需要上下文。 长会话配文件记忆的 1M 上下文;V4 Pro 同为 1M,但它在那种规模下的续航无人验证。
以下情况路由到 DeepSeek(V4 Pro / V4 Flash):
- 量主导。 样板、测试、文档、边界清晰、两者都过门槛的工单,就该归入便宜档。
- 你想要自托管。 MIT 权重、自己的 GPU、代码库不出内网——以 Fable 5 级规模换取完全数据主权,仅此一条。
- 连续性不可妥协。 开放权重无法被出口管制关停。对 Fable 5 这不是假设——发生过 19 天。
监管与所有权背景
两个不在任何基准里的事实,比分数更能左右编码决策:
- Fable 5 强制 30 天数据留存。 对受严格数据驻留或零留存合规约束的代码库,无论质量多高这都是阻塞项。DeepSeek 的 API 是「你的策略」;自托管则完全自控。
- 出口管制是被证实过的风险类别,不是传闻。 Fable 5 于 2026 年 6 月被全球停用 19 天。如果你的 CI/CD 流水线无法容忍模型被关停,这就是支持开放权重的最强论据。
FAQ
做编码时 DeepSeek 比 Fable 5 强吗? 只在特定层级。常规与中等复杂度编码——是,以零头价格提供有竞争力的质量。前沿 Agentic 编码——已发布证据说否:Fable 5 的 80.3% 是官方,DeepSeek 的每个 Agentic 数字都是自报。
做编码时 DeepSeek 便宜多少? V4 Pro 输入约比 Fable 5 便宜 23 倍、输出约 57 倍;V4 Flash 更便宜。在代表性编码负载上综合约 40 倍,而因重试算法,单任务经济差距更悬殊。
我能自托管 DeepSeek 吗? 能——权重为 MIT 许可,这是 Anthropic 任何模型都不允许的。你承担 GPU 与运维,去掉按 token 费用,代码留在公司内部。不过没有服务端安全闸门。
出口管制有影响吗? Fable 5 于 2026 年 6 月被停用 19 天——这是被证实过的风险。API 形式的 DeepSeek 最终对你仍是闭源,但 MIT 权重本身无法被收回,这让自托管的 DeepSeek 成为唯一不会被关停的选项。
我应该用哪个? 前沿 Agentic 编码、多文件重构、长自主运行 → Fable 5(或半价的 Opus 5)。常规、中等复杂度、高流量编码 → DeepSeek V4 Pro 为默认,最便宜档用 V4 Flash。这是「便宜默认 + 昂贵升级」的模式,不是一个模型包打天下。
独立分析,截至 2026-08-05。DeepSeek 的基准数字全部为厂商自报/自报、发布时未经第三方验证;DeepSeek 价格来自其官方 API 文档。参见国产模型盘点、旗舰对比、预算档对比,并用成本计算器算自己的负载。