Kimi K3 对比 Claude Fable 5:开源权重 vs 闭源旗舰
Moonshot Kimi K3(2.8T 开源权重、1M 上下文)对比 Claude Fable 5——编码、基准测试、价格、自托管,以及什么时候中文旗舰是更好的选择。
Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3——2.8 万亿参数的旗舰模型,1M 上下文,开源权重在 7 月 27 日开放。它是首个 3T 参数级的开源模型,目标直指 Claude Fable 5:复杂编码、长链路 agentic 任务,以及中文市场。下面是诚实的对比,每个基准都标注了是谁测的。
Kimi K3 对比 Claude Fable 5:简短回答
最难的编码任务上 Fable 5 依然更强;Kimi K3 是成本与开放性的突破,也是中文场景的更好选择。 Fable 5 仍保持 SWE-Bench Pro 最高公开成绩(80.3%),多数正面交锋的编码评测也占优——但 K3 追得很近:Moonshot 自报 DeepSWE 67.5%,对 Fable 5 的 70.0%;Together AI 的独立复测(2026 年 8 月)显示两者 pass@1 几乎打平(68.5% vs 69.9%)。K3 有 Fable 5 给不了的:可自托管的开源权重(需要真硬件)、价格约为 Fable 5 三分之一的 API,以及 Moonshot 的中文优势。Fable 5 有 K3 给不了的:公开最高分编码成绩、Anthropic 生态,以及(可用时)Fable 级的长期自主能力。
先说明一点:截至 2026 年 8 月 4 日,K3 发布才两周多。几乎所有头条数字都是 Moonshot 自报,独立验证还很少,拿不到确切数字的地方我们会如实标注。
速览
| 规格 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| 厂商 | Moonshot AI(中国) | Anthropic(美国) |
| 发布时间 | 2026 年 7 月 16 日 | 2026 年 6 月 9 日 |
| 参数 | 2.8T 总量,约 50B 激活(16/896 专家) | 未公开(Mythos 级) |
| 上下文窗口 | 1M(1,048,576) | 1M |
| 开放性 | 2026-07-27 开放权重(MXFP4 约 1.4TB);许可条款未完全确认 | 仅闭源 API |
| API 价格(每百万 token) | $3 输入 / $15 输出(缓存命中 $0.30)——Moonshot 官方 | $10 输入 / $50 输出(缓存 $1) |
| 可用渠道 | Moonshot API(国内友好);另有 Together、SiliconFlow、OpenRouter | Anthropic API + Max/Team 订阅;美国出口管制 曾致其 6 月 12 日至 7 月 1 日停用 |
| 自托管 | 可以——约 18 张 H100 80GB 级 GPU,权重约 1.4TB | 不可以 |
基准对照:谁测的,标注清楚
每行都注明来源,因为 K3 太新、独立验证还很少。
| 基准 | Kimi K3 | Claude Fable 5 | 测量方 |
|---|---|---|---|
| SWE-Bench Pro(agentic 编码) | 无公开分数(未确认) | 80.3% | Anthropic 自报(2026-06-09) |
| DeepSWE(agentic 编码) | 67.5%(最高推理档) | 70.0% | Moonshot 自报 |
| DeepSWE pass@1 | 68.5% | 69.9% | Together AI 独立复测(452 次 rollout,2026-08) |
| DeepSWE pass@2 | 82.0% | 80.2% | Together AI 独立复测 |
| Terminal-Bench 2.1 | 88.3% | 84.6% | Moonshot 自报 |
| BrowseComp | 91.2% | 88.0% | Moonshot 自报 |
| FrontierCode Diamond | 无公开分数(未确认) | 29.3% | Anthropic 自报(2026-06-09) |
| Artificial Analysis 智能指数 | 57(189 个模型中第 4) | 未公布(未确认) | Artificial Analysis 独立(2026-08) |
| 前端编码(Arena WebDev) | 第 1 名(初值) | 未参赛 | Arena WebDev 独立 |
| 中文实验室综合榜(BenchAlign v5) | 第 1(79.8) | 不适用(美国厂商) | BenchAlign 独立(2026-08-04) |
诚实的解读:在 Moonshot 自家评测集里,K3 在 DeepSWE 上比 Fable 5 落后 1-3 分,在部分 agentic 评测上反超;目前唯一一项独立正面复测里,pass@1 几乎打平、pass@2 反超。 BrowseComp 和 Terminal-Bench 的领先还没有任何独立复现,K3 在 SWE-Bench Pro 和 FrontierCode 上则根本没有公开分数。Moonshot 自己把 K3 定位为「前沿级但仍落后于」闭源头部——这话是它自己说的,值得信。
成本:真实负载两边各花多少
取一个有代表性的 agent 负载——每月 100 万次 agent 调用,每次平均约 5,000 输入 token、1,500 输出 token(推理密集型编码 agent,按标准 tokenizer 折算估算):
| Kimi K3(API) | Claude Fable 5(API) | |
|---|---|---|
| 输入价(每百万 token) | $3.00 | $10.00 |
| 输出价(每百万 token) | $15.00 | $50.00 |
| 每月输入成本(50 亿 token) | $15,000 | $50,000 |
| 每月输出成本(15 亿 token) | $22,500 | $75,000 |
| 每月合计 | $37,500 | $125,000 |
| 综合每百万 token | ~$5.77 | ~$19.23 |
按成本计算器的算法,Fable 5 的缓存价($1/M)和批量价($5/$25)能省一些,但 3.3 倍的价差是决定性的——每月多花约 $87,500。
自托管 K3 呢? 开源权重(2026-07-27 开放,MXFP4 约 1.4TB)让边际 API 成本消失——但换成了你的硬件账单:光加载模型就要约 18 张 H100 80GB 级加速卡,云上包月约 $50/小时、约 3.6 万美元/月——还没算电费、网络和运维。每月 100 万次调用时,K3 API($37,500)和自建集群成本差不多;自托管图的是数据主权和独立性,不是省钱。消费级硬件跑不了——这不是 DeepSeek V4 Pro。
Kimi K3 赢在哪里
- 中文能力: BenchAlign v5 中文实验室榜第一(79.8,2026-08-04),还有国内 API 接入。中文对话、中文市场内容、数据出境合规场景,K3 是天然选择——而 Fable 5 因美国出口管制停用三周 正是依赖美国 API 的风险写照。
- 开源权重与数据主权: 自托管或选任何你信任的平台。提示词和日志可以不离开你的控制——没有一夜之间被掐断的出口管制开关,也没有 30 天强制留存。
- 价格: API 牌价比 Fable 5 便宜约 3.3 倍;Together 的独立 DeepSWE 复测显示每美元解决的任务约为 2.8 倍。
- 前端编码: 首个登顶 Arena WebDev 前端编码榜的中国模型(初值)。
Claude Fable 5 仍然更强的地方
- 最高公开编码成绩: SWE-Bench Pro 80.3% 与 FrontierCode Diamond 29.3%——K3 在这两项上都没有公开分数,前沿桂冠暂时还在 Fable 5 手里。
- 难题可靠性: 独立复测中,Fable 5 四次全中解决了 58 个任务(K3 为 45 个),已覆盖任务上的可靠性 79.0% vs 76.6%。
- 长链路自主: Fable 5 的文件记忆与多日连续专注——SWE-Bench Pro 与 1M 上下文 让它成为 agentic 默认选择的根本原因——开源这边还没有对等物。
- 生态: Claude Code、Cursor、Max/Team 订阅和 Anthropic 工具链都围绕它构建。
- 欧美数据治理: 对无 30 天留存限制 的 Anthropic 模型而言,企业级零留存记录比一个发布两周多的开源模型成熟得多。
其他开源挑战者见 Fable 5 对比 DeepSeek V4 Pro;Anthropic 自家产品线见 Fable 5 对比 Opus 5。
决策矩阵
- 服务中文用户,或数据必须留在中国境内 → 选 Kimi K3(Moonshot API 或自托管)。这是 K3 最明确的适用场景。
- 需要自托管或数据主权(不想让美国 API 经手)→ 选 Kimi K3——但先算好约 18 卡集群的预算,用成本计算器算清楚再动手。
- 单位成本是决定因素 → Kimi K3,约 3 倍优势。先在真实代码库上测一轮——开源模型的评测分数普遍注水。
- 需要最难的 agentic 编码或多日自主任务 → Claude Fable 5(可用时)或 Opus 5——公开最高分仍在 Anthropic。
- 已经在用 Max/Team 订阅 → 留在 Fable 5;订阅内 API 价差不存在,30 天留存 一般也扛得住。
- 需要随时能开关、不依赖任何人许可的模型 → Kimi K3。2026-07-27 起权重开放——没有等在那里的出口管制开关。
独立分析——在我们的 Fable 5 替代品指南 对比所有选项,或先读基准测试详解,别轻信任何一个数字。