Kimi K3 対 Claude Fable 5:オープンウェイト vs クローズド旗艦
Moonshot Kimi K3(2.8T オープンウェイト・1M コンテキスト)対 Claude Fable 5——コーディング、ベンチマーク、価格、自前ホスト、そして中国語対応でどちらを選ぶべきか。
Moonshot AI は 2026 年 7 月 16 日、Kimi K3 を発表しました。2.8 兆パラメータの旗艦モデル、1M コンテキスト、そしてオープンウェイトは 7 月 27 日に公開されました。3T パラメータ級では初のオープンモデルで、狙いはまさに Claude Fable 5 の土俵——複雑なコーディング、長期間のエージェント作業、そして中国語市場です。以下、すべてのベンチマークに測定元を明記した正直な比較です。
Kimi K3 対 Claude Fable 5:短い答え
最難関のコーディングでは Fable 5 が依然上位。Kimi K3 はコストとオープン性の突破口であり、中国語の作業なら K3 が正解。 Fable 5 は SWE-Bench Pro の最高公開スコア(80.3%)を維持し、対決型のコーディング評価でも概ね優勢です——ただし K3 は驚くほど接近しています。Moonshot 自己申告では DeepSWE 67.5% に対し Fable 5 は 70.0%。Together AI の独立計測(2026年8月)では pass@1 がほぼ互角(68.5% vs 69.9%)でした。K3 が Fable 5 に与えられないものは、自前ホスト可能なオープンウェイト(本物のハードウェアは必要)、約 3 分の 1 の API 価格、そして Moonshot の中国語強みです。Fable 5 が K3 に与えられないものは、最高公開スコアのエージェント型コーディング、Anthropic のエコシステム、そして(利用可能な時の)Fable 級の長期自律性です。
先に断っておきます:2026 年 8 月 4 日 時点で K3 の発表から 2 週間余り。主要な数字はほぼ Moonshot の自己申告で、独立検証はまだ少なく、確認できなかった数字はそのように明記します。
一覧
| 仕様 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| ベンダー | Moonshot AI(中国) | Anthropic(米国) |
| 発表日 | 2026 年 7 月 16 日 | 2026 年 6 月 9 日 |
| パラメータ | 2.8T 合計、約 50B 活性(16/896 エキスパート) | 非公開(Mythos 級) |
| コンテキスト | 1M(1,048,576) | 1M |
| オープン性 | 2026-07-27 オープンウェイト公開(MXFP4 約 1.4TB);ライセンス未完全確認 | クローズド API のみ |
| API 価格(100 万トークンあたり) | 入力 $3 / 出力 $15(キャッシュヒット $0.30)——Moonshot 公式 | 入力 $10 / 出力 $50(キャッシュ $1) |
| 利用経路 | Moonshot API(中国国内向けも)+ Together、SiliconFlow、OpenRouter | Anthropic API + Max/Team プラン;米国輸出管理 で 6/12〜7/1 停止 |
| 自前ホスト | 可——H100 80GB 級 GPU 約 18 枚、ウェイト約 1.4TB | 不可 |
ベンチマーク:測定元を明記
K3 は新しいため独立検証が薄く、各行に測定元を記載します。
| ベンチマーク | Kimi K3 | Claude Fable 5 | 測定元 |
|---|---|---|---|
| SWE-Bench Pro(エージェント型コーディング) | 公開スコアなし(未確認) | 80.3% | Anthropic 自己申告(2026-06-09) |
| DeepSWE(エージェント型コーディング) | 67.5%(最大推論) | 70.0% | Moonshot 自己申告 |
| DeepSWE pass@1 | 68.5% | 69.9% | Together AI 独立計測(452 回 rollout、2026-08) |
| DeepSWE pass@2 | 82.0% | 80.2% | Together AI 独立計測 |
| Terminal-Bench 2.1 | 88.3% | 84.6% | Moonshot 自己申告 |
| BrowseComp | 91.2% | 88.0% | Moonshot 自己申告 |
| FrontierCode Diamond | 公開スコアなし(未確認) | 29.3% | Anthropic 自己申告(2026-06-09) |
| Artificial Analysis 知能指数 | 57(189 モデル中 4 位) | 未公表(未確認) | Artificial Analysis 独立(2026-08) |
| フロントエンドコーディング(Arena WebDev) | 1 位(暫定) | 未参加 | Arena WebDev 独立 |
| 中国ラボ総合(BenchAlign v5) | 1 位(79.8) | 対象外(米国ラボ) | BenchAlign 独立(2026-08-04) |
正直な読み方:Moonshot の自社評価セットでは K3 は DeepSWE で Fable 5 に 1〜3 ポイント差、一部のエージェント評価では上回る。現時点で唯一の独立正面計測では pass@1 がほぼ互角、pass@2 では K3 が上。 BrowseComp と Terminal-Bench のリードはまだ独立再現がなく、K3 には SWE-Bench Pro・FrontierCode の公開スコア自体がありません。Moonshot 自身も K3 を「最前線級だがクローズドの先頭にはまだ及ばない」と位置づけており——これが自社の言葉なので信頼できます。
コスト:実際のワークロードでいくらか
代表的なエージェントワークロード——月 100 万回のエージェント呼び出し、1 回あたり平均入力約 5,000 トークン・出力約 1,500 トークン(推論重視のコーディングエージェント、標準トークナイザ調整 の見積もり):
| Kimi K3(API) | Claude Fable 5(API) | |
|---|---|---|
| 入力価格(100 万トークンあたり) | $3.00 | $10.00 |
| 出力価格(100 万トークンあたり) | $15.00 | $50.00 |
| 月間入力コスト(50 億トークン) | $15,000 | $50,000 |
| 月間出力コスト(15 億トークン) | $22,500 | $75,000 |
| 月間合計 | $37,500 | $125,000 |
| 実効 100 万トークン単価 | 約 $5.77 | 約 $19.23 |
コスト計算ツール の計算では、Fable 5 のキャッシュ価格($1/M)とバッチ価格($5/$25)で多少は下がりますが、3.3 倍の定価差が決定的です——月あたり約 $87,500 の差になります。
K3 の自前ホストは? オープンウェイト(2026-07-27 公開、MXFP4 で約 1.4TB)で API の従量コストは消えますが、代わりに自前のハードウェア代が来ます:モデルのロードだけで H100 80GB 級アクセラレータが約 18 枚、クラウド予約で約 $50/時・月約 $36,000——電気・ネットワーク・運用は別です。月 100 万回なら K3 API($37,500)と自前クラスターはほぼ同等の費用なので、自前ホストはデータ管理と独立性のためであり、節約のためではありません。コンシューマー向けハードウェアでは動きません——DeepSeek V4 Pro とは違います。
Kimi K3 が勝つところ
- 中国語品質: BenchAlign v5 の中国ラボランキングで首位(79.8、2026-08-04)、中国国内 API もあり。中国語の会話、中国市場向けコンテンツ、中国国内データ保存には K3 が自然な選択肢です。米国の API に依存するリスクは、Fable 5 が輸出管理で 3 週間停止した件 が物語っています。
- オープンウェイトとデータ主権: 自前ホストするか、信頼できるプロバイダを選べます。プロンプトとログを自分の管理下に置けます——一夜で止まる輸出管理のスイッチも、30 日間のデータ保持義務 もありません。
- 価格: API 定価が Fable 5 より約 3.3 倍安く、Together の独立 DeepSWE 計測では 1 ドルあたり約 2.8 倍のタスクを解決。
- フロントエンドコーディング: Arena WebDev のフロントエンドコーディングランキングで中国モデル初の 1 位(暫定)。
Claude Fable 5 がまだ勝つところ
- 最高公開コーディングスコア: SWE-Bench Pro 80.3% と FrontierCode Diamond 29.3%——K3 はどちらも公開スコアがなく、最前線の座は今のところ Fable 5 のまま。
- 難しいタスクの信頼性: 独立計測で Fable 5 は 4 回中 4 回成功が 58 タスク(K3 は 45)、カバー済みタスクの信頼率も 79.0% vs 76.6%。
- 長期間の自律性: Fable 5 のファイルメモリと数日にわたる集中——SWE-Bench Pro と 1M コンテキスト がエージェント標準にした理由——に相当するオープンモデルはまだありません。
- エコシステム: Claude Code、Cursor、Max/Team プラン、Anthropic のツール群はすべて Fable 5 を中心に構築されています。
- 米国・EU のデータガバナンス: Anthropic のエンタープライズ向けゼロデータ保持の実績(30 日保持の Fable 5 を除くモデル)は、発表 2 週間のオープンモデルよりはるかに確立されています。
他のオープン挑戦者については Fable 5 対 DeepSeek V4 Pro を、Anthropic 自社の最新ラインナップは Fable 5 対 Opus 5 を参照してください。
選び方
- 中国語ユーザー向け、または中国国内のデータ保存要件がある → Kimi K3(Moonshot API、または自前ホスト)。これが最も明確な K3 のケースです。
- 自前ホストやデータ主権が必要(米国 API を挟みたくない)→ Kimi K3——ただし約 18 枚の GPU クラスターを前提に、先にコスト計算ツール で予算を確認してください。
- タスク 1 件あたりのコストが決め手 → Kimi K3(約 3 倍)。ただし実リポジトリで先に試してください。オープンモデルの評価スコアは水増しが付きものです。
- 最難関のエージェント型コーディングや数日単位の自律作業が必要 → Claude Fable 5(利用可能な時)か Opus 5——最高公開スコアは依然 Anthropic にあります。
- すでに Max/Team プラン利用中 → Fable 5 のまま。サブスク内では API 価格差は関係なく、30 日保持 は通常許容範囲です。
- 誰の許可もなしに使ったり止めたりできるモデルが必要 → Kimi K3。2026-07-27 にオープンウェイト公開済み——輸出管理のスイッチはありません。
独立分析——すべての選択肢を Fable 5 の代替ガイド で比較。数字を信じる前に ベンチマーク解説 もどうぞ。