文中数据截至 2026 年 9 月 14 日,DeepSeek 一侧为官方自报
V4.1 Flash 于 2026 年 9 月 10 日发布,跑分全部出自 DeepSeek 官方 model card,截至本页核对时 Artificial Analysis 等第三方尚未复测;价格分别取自 DeepSeek 官方价卡(闲时价)与 Anthropic 公开定价。
看我们此前的 DeepSeek V4 Pro 对比DeepSeek V4.1 Flash 对比 Claude Fable 5.1 · 2026年9月
DeepSeek V4.1 Flash 对比 Claude Fable 5.1
一边是闲时 $0.15、MIT 开源权重的 MoE 模型,一边是 $10/$50 的闭源旗舰——同为 1M 上下文,价格和证据的可信度差距同样悬殊。
太长不看
DeepSeek V4.1 Flash 官方闲时价为每百万 tokens 输入 $0.15、输出 $0.60(高峰时段翻倍),Claude Fable 5.1 全天固定 $10/$50——按 2026 年 9 月 14 日的价卡,输入价差约 67 倍。V4.1 Flash 是 552B 参数 MoE、MIT 开源权重、1M 上下文、384K 最大输出;它的 agentic 编程跑分截至发稿只有 DeepSeek 官方数据。Fable 5.1 一侧的 SWE-bench Verified 87.7% 与 Anthropic 公开定价,是目前可核验的一方。
规格速览
DeepSeek 为官方闲时价;高峰时段(UTC 周一至周五 01:00-04:00、06:00-10:00)价格翻倍。Fable 5.1 为 Anthropic 牌价,7×24 全上下文同价。
| 项目 | DeepSeek V4.1 Flash | Claude Fable 5.1 |
|---|---|---|
| 模型 ID | deepseek-flash | claude-fable-5-1-20260902 |
| 发布时间 | 2026年9月10日 | 2026年9月2日 |
| 输入价格(每百万 tokens) | $0.15 | $10.00 |
| 输出价格(每百万 tokens) | $0.60 | $50.00 |
| 高峰计费 | 高峰时段翻倍($0.30 / $1.20) | 全天全窗口统一价 |
| 缓存读取(每百万 tokens) | $0.003 | $0.25 |
| 架构 | 552B MoE(prefill 激活 8B,decode 激活 16B) | 未公开(闭源 API) |
| 权重与许可 | MIT 开源权重(约 510 GB,FP8) | 闭源,仅 API 与云托管 |
| 上下文窗口 | 1M | 1M |
| 最大输出 | 384K | 128K |
输入价差 67 倍,输出 83 倍。DeepSeek 自动前缀缓存命中价 $0.003/百万 tokens、不收写入费;Fable 5.1 的读取价 $0.25/百万 tokens、写入另计(5 分钟 $12.50)。自建一侧的门槛也在反转:V4.1 Flash 的 552B MIT 权重约 510 GB(FP8),起步基本是 8 卡节点;Fable 5.1 则完全没有开源权重。
跑分:官方自报 vs 可核验
DeepSeek 称 V4.1 Flash 在 agentic 与编程套件上全面超过 V4 Pro;Fable 5.1 公开可查的编程强项是 SWE-bench Verified 87.7%。两者唯一重叠的同代测试是 Terminal-Bench 4.0,且跑在不同的 harness 里。
| 项目 | DeepSeek V4.1 Flash | Claude Fable 5.1 |
|---|---|---|
| SWE-bench Verified | 未公布 | 87.7% |
| DeepSWE v1.1 | 74.2% | 未公布 |
| Terminal-Bench 2.1 | 90.6% | 未公布 |
| Terminal-Bench 4.0 | 31.2% | 55.8% |
| GPQA Diamond | 90.9% | 未公布 |
| HLE(无工具) | 36.8% | 未公布 |
来源:DeepSWE、Terminal-Bench 2.1、GPQA Diamond、HLE 均为 DeepSeek 官方 model card 数据(2026年9月10日,最高推理档),尚未经第三方复测;Terminal-Bench 4.0 一行是跨 harness 对比——31.2% 出自 DeepSeek 自测,55.8% 出自 OpenAI 发布 GPT-6 Astra 时的同 harness 实测。SWE-bench Verified 为 Anthropic 公布,DeepSeek 未参测。跨来源的分数对比仅供参考。
怎么选
同是 1M 窗口,价格与验证标准完全不同。按负载路由。
高频 agent 负载,账单是第一约束
闲时 $0.15/$0.60 意味着 agent 循环的输入成本只剩零头;周末和北美白天的大部分时段都按闲时计费。如果卡预算的是成本而不是能力,这笔账很难拒绝。
需要第三方可复核的编程成绩
Fable 5.1 有公开的 SWE-bench Verified 87.7% 与 Artificial Analysis 覆盖;V4.1 Flash 的 DeepSWE 74.2、Terminal-Bench 2.1 90.6 截至 9 月 14 日仍是官方自报。团队评估依赖外部复现数据的话,可核验的一方在 Fable 5.1。
要自己掌握权重,而不是只调 API
MIT 协议、约 510 GB FP8 检查点、vLLM/SGLang 首发支持——私有化部署可行,但起点基本是 8 卡节点。Fable 5.1 没有开源权重,只能走 Anthropic API、Bedrock、Vertex AI 等云托管渠道。
纯知识推理为主、不吃工具链
DeepSeek 自己的跑分也给出上限:HLE 36.8,低于 V4 Pro 的 42.7——V4.1 Flash 快在 agentic 执行,不在无工具知识推理。长文分析、没有检索辅助的复杂判断,仍优先 Fable 5.1。
输入大量重复——靠缓存吃饭
重复读同一份上下文时,决定成本的是缓存价:DeepSeek 闲时 $0.003/百万 tokens、无写入费;Fable 5.1 为 $0.25(写入另计)。两者都把自家未缓存价打掉了两个数量级,Anthropic 一侧的计费细节见我们的 prompt caching 专页。
一句话:V4.1 Flash 用 1/67 的输入价和真正的开源权重,换走第三方验证、峰谷计费与知识推理上限;Fable 5.1 卖的是已验证的编程深度与全窗口平价。等 Artificial Analysis 复测数据落地,这个结论可能要改写——我们会跟进更新。