返回博客

Kimi K3 对比 Claude Fable 5:开源权重 vs 闭源旗舰

Moonshot Kimi K3(2.8T 开源权重、1M 上下文)对比 Claude Fable 5——编码、基准测试、价格、自托管,以及什么时候中文旗舰是更好的选择。

2026年8月4日Fable5 编辑部Fable5 编辑部

Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3——2.8 万亿参数的旗舰模型,1M 上下文,开源权重在 7 月 27 日开放。它是首个 3T 参数级的开源模型,目标直指 Claude Fable 5:复杂编码、长链路 agentic 任务,以及中文市场。下面是诚实的对比,每个基准都标注了是谁测的。

Kimi K3 对比 Claude Fable 5:简短回答

最难的编码任务上 Fable 5 依然更强;Kimi K3 是成本与开放性的突破,也是中文场景的更好选择。 Fable 5 仍保持 SWE-Bench Pro 最高公开成绩(80.3%),多数正面交锋的编码评测也占优——但 K3 追得很近:Moonshot 自报 DeepSWE 67.5%,对 Fable 5 的 70.0%;Together AI 的独立复测(2026 年 8 月)显示两者 pass@1 几乎打平(68.5% vs 69.9%)。K3 有 Fable 5 给不了的:可自托管的开源权重(需要真硬件)、价格约为 Fable 5 三分之一的 API,以及 Moonshot 的中文优势。Fable 5 有 K3 给不了的:公开最高分编码成绩、Anthropic 生态,以及(可用时)Fable 级的长期自主能力。

先说明一点:截至 2026 年 8 月 4 日,K3 发布才两周多。几乎所有头条数字都是 Moonshot 自报,独立验证还很少,拿不到确切数字的地方我们会如实标注。

速览

规格Kimi K3Claude Fable 5
厂商Moonshot AI(中国)Anthropic(美国)
发布时间2026 年 7 月 16 日2026 年 6 月 9 日
参数2.8T 总量,约 50B 激活(16/896 专家)未公开(Mythos 级)
上下文窗口1M(1,048,576)1M
开放性2026-07-27 开放权重(MXFP4 约 1.4TB);许可条款未完全确认仅闭源 API
API 价格(每百万 token)$3 输入 / $15 输出(缓存命中 $0.30)——Moonshot 官方$10 输入 / $50 输出(缓存 $1)
可用渠道Moonshot API(国内友好);另有 Together、SiliconFlow、OpenRouterAnthropic API + Max/Team 订阅;美国出口管制 曾致其 6 月 12 日至 7 月 1 日停用
自托管可以——约 18 张 H100 80GB 级 GPU,权重约 1.4TB不可以

基准对照:谁测的,标注清楚

每行都注明来源,因为 K3 太新、独立验证还很少。

基准Kimi K3Claude Fable 5测量方
SWE-Bench Pro(agentic 编码)无公开分数(未确认)80.3%Anthropic 自报(2026-06-09)
DeepSWE(agentic 编码)67.5%(最高推理档)70.0%Moonshot 自报
DeepSWE pass@168.5%69.9%Together AI 独立复测(452 次 rollout,2026-08)
DeepSWE pass@282.0%80.2%Together AI 独立复测
Terminal-Bench 2.188.3%84.6%Moonshot 自报
BrowseComp91.2%88.0%Moonshot 自报
FrontierCode Diamond无公开分数(未确认)29.3%Anthropic 自报(2026-06-09)
Artificial Analysis 智能指数57(189 个模型中第 4)未公布(未确认)Artificial Analysis 独立(2026-08)
前端编码(Arena WebDev)第 1 名(初值)未参赛Arena WebDev 独立
中文实验室综合榜(BenchAlign v5)第 1(79.8)不适用(美国厂商)BenchAlign 独立(2026-08-04)

诚实的解读:在 Moonshot 自家评测集里,K3 在 DeepSWE 上比 Fable 5 落后 1-3 分,在部分 agentic 评测上反超;目前唯一一项独立正面复测里,pass@1 几乎打平、pass@2 反超。 BrowseComp 和 Terminal-Bench 的领先还没有任何独立复现,K3 在 SWE-Bench Pro 和 FrontierCode 上则根本没有公开分数。Moonshot 自己把 K3 定位为「前沿级但仍落后于」闭源头部——这话是它自己说的,值得信。

成本:真实负载两边各花多少

取一个有代表性的 agent 负载——每月 100 万次 agent 调用,每次平均约 5,000 输入 token、1,500 输出 token(推理密集型编码 agent,按标准 tokenizer 折算估算):

Kimi K3(API)Claude Fable 5(API)
输入价(每百万 token)$3.00$10.00
输出价(每百万 token)$15.00$50.00
每月输入成本(50 亿 token)$15,000$50,000
每月输出成本(15 亿 token)$22,500$75,000
每月合计$37,500$125,000
综合每百万 token~$5.77~$19.23

成本计算器的算法,Fable 5 的缓存价($1/M)和批量价($5/$25)能省一些,但 3.3 倍的价差是决定性的——每月多花约 $87,500

自托管 K3 呢? 开源权重(2026-07-27 开放,MXFP4 约 1.4TB)让边际 API 成本消失——但换成了的硬件账单:光加载模型就要约 18 张 H100 80GB 级加速卡,云上包月约 $50/小时、约 3.6 万美元/月——还没算电费、网络和运维。每月 100 万次调用时,K3 API($37,500)和自建集群成本差不多;自托管图的是数据主权和独立性,不是省钱。消费级硬件跑不了——这不是 DeepSeek V4 Pro。

Kimi K3 赢在哪里

  • 中文能力: BenchAlign v5 中文实验室榜第一(79.8,2026-08-04),还有国内 API 接入。中文对话、中文市场内容、数据出境合规场景,K3 是天然选择——而 Fable 5 因美国出口管制停用三周 正是依赖美国 API 的风险写照。
  • 开源权重与数据主权: 自托管或选任何你信任的平台。提示词和日志可以不离开你的控制——没有一夜之间被掐断的出口管制开关,也没有 30 天强制留存
  • 价格: API 牌价比 Fable 5 便宜约 3.3 倍;Together 的独立 DeepSWE 复测显示每美元解决的任务约为 2.8 倍。
  • 前端编码: 首个登顶 Arena WebDev 前端编码榜的中国模型(初值)。

Claude Fable 5 仍然更强的地方

  • 最高公开编码成绩: SWE-Bench Pro 80.3% 与 FrontierCode Diamond 29.3%——K3 在这两项上都没有公开分数,前沿桂冠暂时还在 Fable 5 手里。
  • 难题可靠性: 独立复测中,Fable 5 四次全中解决了 58 个任务(K3 为 45 个),已覆盖任务上的可靠性 79.0% vs 76.6%。
  • 长链路自主: Fable 5 的文件记忆与多日连续专注——SWE-Bench Pro 与 1M 上下文 让它成为 agentic 默认选择的根本原因——开源这边还没有对等物。
  • 生态: Claude Code、Cursor、Max/Team 订阅和 Anthropic 工具链都围绕它构建。
  • 欧美数据治理: 对无 30 天留存限制 的 Anthropic 模型而言,企业级零留存记录比一个发布两周多的开源模型成熟得多。

其他开源挑战者见 Fable 5 对比 DeepSeek V4 Pro;Anthropic 自家产品线见 Fable 5 对比 Opus 5

决策矩阵

  • 服务中文用户,或数据必须留在中国境内 →Kimi K3(Moonshot API 或自托管)。这是 K3 最明确的适用场景。
  • 需要自托管或数据主权(不想让美国 API 经手)→Kimi K3——但先算好约 18 卡集群的预算,用成本计算器算清楚再动手。
  • 单位成本是决定因素 → Kimi K3,约 3 倍优势。先在真实代码库上测一轮——开源模型的评测分数普遍注水。
  • 需要最难的 agentic 编码或多日自主任务 → Claude Fable 5(可用时)或 Opus 5——公开最高分仍在 Anthropic。
  • 已经在用 Max/Team 订阅 → 留在 Fable 5;订阅内 API 价差不存在,30 天留存 一般也扛得住。
  • 需要随时能开关、不依赖任何人许可的模型 → Kimi K3。2026-07-27 起权重开放——没有等在那里的出口管制开关。

独立分析——在我们的 Fable 5 替代品指南 对比所有选项,或先读基准测试详解,别轻信任何一个数字。

相关文章