ブログに戻る

Kimi K3 対 Claude Fable 5:オープンウェイト vs クローズド旗艦

Moonshot Kimi K3(2.8T オープンウェイト・1M コンテキスト)対 Claude Fable 5——コーディング、ベンチマーク、価格、自前ホスト、そして中国語対応でどちらを選ぶべきか。

2026年8月4日Fable5 編集部Fable5 編集部

Moonshot AI は 2026 年 7 月 16 日、Kimi K3 を発表しました。2.8 兆パラメータの旗艦モデル、1M コンテキスト、そしてオープンウェイトは 7 月 27 日に公開されました。3T パラメータ級では初のオープンモデルで、狙いはまさに Claude Fable 5 の土俵——複雑なコーディング、長期間のエージェント作業、そして中国語市場です。以下、すべてのベンチマークに測定元を明記した正直な比較です。

Kimi K3 対 Claude Fable 5:短い答え

最難関のコーディングでは Fable 5 が依然上位。Kimi K3 はコストとオープン性の突破口であり、中国語の作業なら K3 が正解。 Fable 5 は SWE-Bench Pro の最高公開スコア(80.3%)を維持し、対決型のコーディング評価でも概ね優勢です——ただし K3 は驚くほど接近しています。Moonshot 自己申告では DeepSWE 67.5% に対し Fable 5 は 70.0%。Together AI の独立計測(2026年8月)では pass@1 がほぼ互角(68.5% vs 69.9%)でした。K3 が Fable 5 に与えられないものは、自前ホスト可能なオープンウェイト(本物のハードウェアは必要)、約 3 分の 1 の API 価格、そして Moonshot の中国語強みです。Fable 5 が K3 に与えられないものは、最高公開スコアのエージェント型コーディング、Anthropic のエコシステム、そして(利用可能な時の)Fable 級の長期自律性です。

先に断っておきます:2026 年 8 月 4 日 時点で K3 の発表から 2 週間余り。主要な数字はほぼ Moonshot の自己申告で、独立検証はまだ少なく、確認できなかった数字はそのように明記します。

一覧

仕様Kimi K3Claude Fable 5
ベンダーMoonshot AI(中国)Anthropic(米国)
発表日2026 年 7 月 16 日2026 年 6 月 9 日
パラメータ2.8T 合計、約 50B 活性(16/896 エキスパート)非公開(Mythos 級)
コンテキスト1M(1,048,576)1M
オープン性2026-07-27 オープンウェイト公開(MXFP4 約 1.4TB);ライセンス未完全確認クローズド API のみ
API 価格(100 万トークンあたり)入力 $3 / 出力 $15(キャッシュヒット $0.30)——Moonshot 公式入力 $10 / 出力 $50(キャッシュ $1)
利用経路Moonshot API(中国国内向けも)+ Together、SiliconFlow、OpenRouterAnthropic API + Max/Team プラン;米国輸出管理 で 6/12〜7/1 停止
自前ホスト可——H100 80GB 級 GPU 約 18 枚、ウェイト約 1.4TB不可

ベンチマーク:測定元を明記

K3 は新しいため独立検証が薄く、各行に測定元を記載します。

ベンチマークKimi K3Claude Fable 5測定元
SWE-Bench Pro(エージェント型コーディング)公開スコアなし(未確認)80.3%Anthropic 自己申告(2026-06-09)
DeepSWE(エージェント型コーディング)67.5%(最大推論)70.0%Moonshot 自己申告
DeepSWE pass@168.5%69.9%Together AI 独立計測(452 回 rollout、2026-08)
DeepSWE pass@282.0%80.2%Together AI 独立計測
Terminal-Bench 2.188.3%84.6%Moonshot 自己申告
BrowseComp91.2%88.0%Moonshot 自己申告
FrontierCode Diamond公開スコアなし(未確認)29.3%Anthropic 自己申告(2026-06-09)
Artificial Analysis 知能指数57(189 モデル中 4 位)未公表(未確認)Artificial Analysis 独立(2026-08)
フロントエンドコーディング(Arena WebDev)1 位(暫定)未参加Arena WebDev 独立
中国ラボ総合(BenchAlign v5)1 位(79.8)対象外(米国ラボ)BenchAlign 独立(2026-08-04)

正直な読み方:Moonshot の自社評価セットでは K3 は DeepSWE で Fable 5 に 1〜3 ポイント差、一部のエージェント評価では上回る。現時点で唯一の独立正面計測では pass@1 がほぼ互角、pass@2 では K3 が上。 BrowseComp と Terminal-Bench のリードはまだ独立再現がなく、K3 には SWE-Bench Pro・FrontierCode の公開スコア自体がありません。Moonshot 自身も K3 を「最前線級だがクローズドの先頭にはまだ及ばない」と位置づけており——これが自社の言葉なので信頼できます。

コスト:実際のワークロードでいくらか

代表的なエージェントワークロード——月 100 万回のエージェント呼び出し、1 回あたり平均入力約 5,000 トークン・出力約 1,500 トークン(推論重視のコーディングエージェント、標準トークナイザ調整 の見積もり):

Kimi K3(API)Claude Fable 5(API)
入力価格(100 万トークンあたり)$3.00$10.00
出力価格(100 万トークンあたり)$15.00$50.00
月間入力コスト(50 億トークン)$15,000$50,000
月間出力コスト(15 億トークン)$22,500$75,000
月間合計$37,500$125,000
実効 100 万トークン単価約 $5.77約 $19.23

コスト計算ツール の計算では、Fable 5 のキャッシュ価格($1/M)とバッチ価格($5/$25)で多少は下がりますが、3.3 倍の定価差が決定的です——月あたり約 $87,500 の差になります。

K3 の自前ホストは? オープンウェイト(2026-07-27 公開、MXFP4 で約 1.4TB)で API の従量コストは消えますが、代わりに自前のハードウェア代が来ます:モデルのロードだけで H100 80GB 級アクセラレータが約 18 枚、クラウド予約で約 $50/時・月約 $36,000——電気・ネットワーク・運用は別です。月 100 万回なら K3 API($37,500)と自前クラスターはほぼ同等の費用なので、自前ホストはデータ管理と独立性のためであり、節約のためではありません。コンシューマー向けハードウェアでは動きません——DeepSeek V4 Pro とは違います。

Kimi K3 が勝つところ

  • 中国語品質: BenchAlign v5 の中国ラボランキングで首位(79.8、2026-08-04)、中国国内 API もあり。中国語の会話、中国市場向けコンテンツ、中国国内データ保存には K3 が自然な選択肢です。米国の API に依存するリスクは、Fable 5 が輸出管理で 3 週間停止した件 が物語っています。
  • オープンウェイトとデータ主権: 自前ホストするか、信頼できるプロバイダを選べます。プロンプトとログを自分の管理下に置けます——一夜で止まる輸出管理のスイッチも、30 日間のデータ保持義務 もありません。
  • 価格: API 定価が Fable 5 より約 3.3 倍安く、Together の独立 DeepSWE 計測では 1 ドルあたり約 2.8 倍のタスクを解決。
  • フロントエンドコーディング: Arena WebDev のフロントエンドコーディングランキングで中国モデル初の 1 位(暫定)。

Claude Fable 5 がまだ勝つところ

  • 最高公開コーディングスコア: SWE-Bench Pro 80.3% と FrontierCode Diamond 29.3%——K3 はどちらも公開スコアがなく、最前線の座は今のところ Fable 5 のまま。
  • 難しいタスクの信頼性: 独立計測で Fable 5 は 4 回中 4 回成功が 58 タスク(K3 は 45)、カバー済みタスクの信頼率も 79.0% vs 76.6%。
  • 長期間の自律性: Fable 5 のファイルメモリと数日にわたる集中——SWE-Bench Pro と 1M コンテキスト がエージェント標準にした理由——に相当するオープンモデルはまだありません。
  • エコシステム: Claude Code、Cursor、Max/Team プラン、Anthropic のツール群はすべて Fable 5 を中心に構築されています。
  • 米国・EU のデータガバナンス: Anthropic のエンタープライズ向けゼロデータ保持の実績(30 日保持の Fable 5 を除くモデル)は、発表 2 週間のオープンモデルよりはるかに確立されています。

他のオープン挑戦者については Fable 5 対 DeepSeek V4 Pro を、Anthropic 自社の最新ラインナップは Fable 5 対 Opus 5 を参照してください。

選び方

  • 中国語ユーザー向け、または中国国内のデータ保存要件がある → Kimi K3(Moonshot API、または自前ホスト)。これが最も明確な K3 のケースです。
  • 自前ホストやデータ主権が必要(米国 API を挟みたくない)→ Kimi K3——ただし約 18 枚の GPU クラスターを前提に、先にコスト計算ツール で予算を確認してください。
  • タスク 1 件あたりのコストが決め手 → Kimi K3(約 3 倍)。ただし実リポジトリで先に試してください。オープンモデルの評価スコアは水増しが付きものです。
  • 最難関のエージェント型コーディングや数日単位の自律作業が必要 → Claude Fable 5(利用可能な時)か Opus 5——最高公開スコアは依然 Anthropic にあります。
  • すでに Max/Team プラン利用中 → Fable 5 のまま。サブスク内では API 価格差は関係なく、30 日保持 は通常許容範囲です。
  • 誰の許可もなしに使ったり止めたりできるモデルが必要 → Kimi K3。2026-07-27 にオープンウェイト公開済み——輸出管理のスイッチはありません。

独立分析——すべての選択肢を Fable 5 の代替ガイド で比較。数字を信じる前に ベンチマーク解説 もどうぞ。

関連記事