返回博客

Fable 5 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)

2026 年 8 月的 Claude Fable 5 vs DeepSeek V4 Pro 与 V4 Flash 做编程工作:Agentic 编码质量、开放权重自托管、出口管制背景,以及扭转通过率之争的「每个已解决问题成本」算法。

2026年8月5日Fable5 编辑部Fable5 编辑部
Fable 5 对比 DeepSeek 做编码:基准与「每个已解决问题成本」(2026)

TL;DR(截至 2026-08-05):编码而言,通过率差距是真的,价格差距也是真的。Fable 5 在 SWE-Bench Pro 上 80.3%(Anthropic 官方),DeepSeek V4 Pro 在同一测试名上自称 55.4%——但 V4 Pro 每百万 token $0.435/$0.87,对比 Fable 5 的 $10/$50,输入约便宜 23 倍,V4 Flash 更便宜,为 $0.14/$0.28。这改变了你评估它们的方式:按「每个已解决问题成本」排名,而不是通过率。 在约 23 倍的输入价差下,DeepSeek 失败很多次才抵得上 Fable 5 单次尝试的成本——但 Fable 5 每次尝试真正解决问题的概率要高得多。常规与中等复杂度编码,DeepSeek 是理性默认;前沿 Agentic 编码,Fable 5 是天花板。动手前用成本计算器算自己的负载。

编码问题,诚实地讲

多数「Fable 5 vs DeepSeek」对比文拿两个模型在一个分数上比,就下结论。用于编码,这会塌掉一个真正的决策。诚实的框架有三部分:

  1. 基准并不对等。 Fable 5 的 80.3% SWE-Bench Pro 是 Anthropic 官方发布数据。DeepSeek 在同一测试名上的 55.4%,以及 V4 的每一个数字,都来自 DeepSeek 自家技术报告——截至 2026-08-05 无任何独立验证。「未确认」才是对 DeepSeek 各行的准确标签。
  2. 价差巨大。 DeepSeek 约便宜 23 倍的输入不只是省钱——它改变了编码的重试算法
  3. 任务层级决定赢家。 常规/中等复杂度编码与前沿 Agentic 编码是不同的问题,两个模型在各自层级的排名不同。

模型并排对比

规格Claude Fable 5DeepSeek V4 ProDeepSeek V4 Flash
厂商AnthropicDeepSeekDeepSeek
定位Mythos 级旗舰开放权重前沿挑战者预算开放权重档
输入/输出价格(每百万 token)$10 / $50$0.435 / $0.87$0.14 / $0.28
缓存命中输入(每百万 token)$1$0.003625≈$0.0012
上下文窗口1M1M1M
SWE-Bench Pro(Agentic 编码)80.3%(官方)55.4%(自报)未公布
许可闭源,仅 APIMIT 开放权重MIT 开放权重
数据留存强制 30 天你的策略(API)/ 完全自控(自托管)与 V4 Pro 相同
出口管制风险已证实——6 月 12 日至 7 月 1 日停用 19 天无——权重无法被收回

价格核实于 2026-08-05:Anthropic 价格见模型定价页,DeepSeek 价格见官方 API 文档。V4 Flash 的缓存价格为按公布费率估算;DeepSeek 已宣布未来将实行 2 倍高峰时段加价(北京时间 09:00–12:00 与 14:00–18:00),生效日期未定。

编码基准:发布了什么、由谁发布

基准Fable 5V4 ProV4 Flash来源
SWE-Bench Pro80.3%55.4%未公布Fable 5:Anthropic 官方。V4 Pro:DeepSeek 技术报告(自报)
SWE-Bench Verified未公布80.6%未公布DeepSeek 技术报告(自报)
LiveCodeBench未公布93.5未公布DeepSeek 技术报告(自报)
Codeforces(评级)未公布3206未公布DeepSeek 技术报告(自报)
Terminal-Bench 2.0未公布67.9%未公布DeepSeek 技术报告(自报)
FrontierCode(Diamond)29.3%未公布未公布Anthropic 官方

引用任何数字前请记住三条:

  • 唯一的「重合项」是个陷阱。 两家都公布「SWE-Bench Pro」(80.3% vs 55.4%),但 V4 Pro 的数字是 DeepSeek 自己跑的分,零第三方复现。测试同名,可信度不同。SWE-Bench VerifiedPro 是不同测试集——不要拿 V4 Pro 的 80.6% 去和 Fable 5 的 80.3% 直接比。
  • V4 Pro 的数字来自最高推理档(「Thinking Max」)。默认或低档预期要打折。
  • DeepSeek 自己说 V4 落后前沿模型约 3–6 个月。 这是厂商自己的坦诚,也与下面的「日常 vs 前沿」分野一致。

每个已解决问题成本:通过率之争如何反转

通过率差距看起来对 Fable 5 一边倒。但成本对比反转了结论。以下是算法。

以一个代表性编码 Agent 任务为例:60,000 token 输入(代码库上下文 + 指令)、2,000 token 输出(补丁),输入侧提示词缓存命中率 80%。

任务Claude Fable 5DeepSeek V4 Pro
每次尝试输入(60K,80% 缓存)≈ $0.13≈ $0.0050
每次尝试输出(2K)$0.10$0.0017
每次尝试成本≈ $0.23≈ $0.0067

DeepSeek 的每次尝试便宜 约 34 倍。具体地说,V4 Pro 可以失败三十多次,才花掉 Fable 5 单次尝试的成本。现在把解决率算进去:

  • 每个已解决问题(Fable 5): ≈ $0.23 / 0.80 ≈ $0.29
  • 每个已解决问题(V4 Pro,55%): ≈ $0.0067 / 0.55 ≈ $0.012

即便 V4 Pro 的解决率只有 Fable 5 的一半,它在真正能解决的层级上,每个已解决问题的成本仍约低 20 倍。DeepSeek 的经济性如此一边倒,决策不再是「哪个模型更聪明」,而是**「这个任务在我便宜可解的层级里吗?」**:

  • 常规与中等复杂度编码——绝大多数样板、重构、代码片段、边界清晰的工单——几乎总该归入便宜档。无论蓝筹基准差距多大,DeepSeek 约 20 倍更低的每个已解决问题成本都胜出。
  • 前沿 Agentic 编码——跨文件横切重构、长链路自主运行、会级联的架构决策——重试算法在这里反过来。如果一个任务接近便宜模型的能力边缘,它的失败尝试就不再免费,一次能解决它的 Fable 5 通过反而成为更便宜更快的路径。这正是「更贵的模型可能更便宜」的论点,在约 23 倍输入价差下更有力——前提是便宜模型确实解不了。

成本计算器算自己的数字。Fable 5 一侧还带有强制 30 天数据留存,以及如果代码涉及网络或生物领域值得计入的安全闸门回退项。

编码上各自胜出的地方

以下情况路由到 Fable 5:

  1. 任务 Agentic 且长链路。 多文件、多步骤、自主的工作正是基准表所讲的那个差距。
  2. 架构决策要紧。 会像涟漪一样波及整个代码库的决策,奖励的是天花板最高的模型,而不是最便宜的重试。
  3. 你需要上下文。 长会话配文件记忆的 1M 上下文;V4 Pro 同为 1M,但它在那种规模下的续航无人验证。

以下情况路由到 DeepSeek(V4 Pro / V4 Flash):

  1. 量主导。 样板、测试、文档、边界清晰、两者都过门槛的工单,就该归入便宜档。
  2. 你想要自托管。 MIT 权重、自己的 GPU、代码库不出内网——以 Fable 5 级规模换取完全数据主权,仅此一条。
  3. 连续性不可妥协。 开放权重无法被出口管制关停。对 Fable 5 这不是假设——发生过 19 天。

监管与所有权背景

两个不在任何基准里的事实,比分数更能左右编码决策:

  • Fable 5 强制 30 天数据留存。 对受严格数据驻留或零留存合规约束的代码库,无论质量多高这都是阻塞项。DeepSeek 的 API 是「你的策略」;自托管则完全自控。
  • 出口管制是被证实过的风险类别,不是传闻。 Fable 5 于 2026 年 6 月被全球停用 19 天。如果你的 CI/CD 流水线无法容忍模型被关停,这就是支持开放权重的最强论据。

FAQ

做编码时 DeepSeek 比 Fable 5 强吗? 只在特定层级。常规与中等复杂度编码——是,以零头价格提供有竞争力的质量。前沿 Agentic 编码——已发布证据说否:Fable 5 的 80.3% 是官方,DeepSeek 的每个 Agentic 数字都是自报。

做编码时 DeepSeek 便宜多少? V4 Pro 输入约比 Fable 5 便宜 23 倍、输出约 57 倍;V4 Flash 更便宜。在代表性编码负载上综合约 40 倍,而因重试算法,单任务经济差距更悬殊。

我能自托管 DeepSeek 吗? 能——权重为 MIT 许可,这是 Anthropic 任何模型都不允许的。你承担 GPU 与运维,去掉按 token 费用,代码留在公司内部。不过没有服务端安全闸门。

出口管制有影响吗? Fable 5 于 2026 年 6 月被停用 19 天——这是被证实过的风险。API 形式的 DeepSeek 最终对你仍是闭源,但 MIT 权重本身无法被收回,这让自托管的 DeepSeek 成为唯一不会被关停的选项。

我应该用哪个? 前沿 Agentic 编码、多文件重构、长自主运行 → Fable 5(或半价的 Opus 5)。常规、中等复杂度、高流量编码 → DeepSeek V4 Pro 为默认,最便宜档用 V4 Flash。这是「便宜默认 + 昂贵升级」的模式,不是一个模型包打天下。

独立分析,截至 2026-08-05。DeepSeek 的基准数字全部为厂商自报/自报、发布时未经第三方验证;DeepSeek 价格来自其官方 API 文档。参见国产模型盘点旗舰对比预算档对比,并用成本计算器算自己的负载。

相关文章