Kimi K3 vs Kimi K2.7 コードの比較と変更点

Kimi K3とKimi K2.7のコード比較:スケールの飛躍、新しいアテンションアーキテクチャ、1Mコンテキスト、料金体系の変更、そして明確な移行/維持の判断ガイド。

INEZA Felin-Michel

INEZA Felin-Michel

17 7月 2026

Kimi K3 vs Kimi K2.7 コードの比較と変更点

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Kimiを既に導入している場合、2026年7月16日にリリースされるKimi K3について、ある実用的な疑問が浮かびます。これは乗り換えるべきアップグレードなのか、それとも現時点ではスキップできる、より大規模で高価なモデルなのか?Kimi K2.7 Codeは、K2系列のコーディングに特化したリリースであり、多くのチームが前四半期にこれをエージェントやCIに組み込みました。K3は全く異なるものです。Moonshotの新しいフラッグシップモデルであり、はるかに大規模に構築され、新しいアテンション設計と100万トークンのコンテキストウィンドウを備えています。この記事では、実際に何が変わったのか、何がマーケティングなのか、そして移行すべきかどうかを決定する方法を詳しく説明します。

私たちはここで中立ではありません。両モデルに関するガイドを執筆したため、これは同僚に伝える率直なアップグレードノートです。どちらもOpenAI互換のAPIを公開しているため、実際のプロダクションコードを書き換える前に、Apidogkimi-k3kimi-k2-7-codeに同じリクエストを並行して実行し、出力、レイテンシー、トークン消費の違いを確認できます。まずは結論から。

ダウンロード

TL;DR: 一目でわかる評価

2種類のモデル

スペックを比較する前に、これだけは理解しておいてください。K2.7 CodeとK3は、異なる目的のために構築されました。

Kimi K2.7 Codeは、K2系列(K2、K2 Thinking、K2.5、K2.6、そしてK2.7 Code)のコーディングに特化したモデルであり、その性能は約1兆パラメータクラスで頂点に達しました。この系列は、コード生成、編集、およびエージェント型開発タスクに強く焦点を当てていました。「APIを通じてコードを書き、修正する」ことがあなたの仕事であれば、調整された費用対効果の高い選択肢でした。K2.7 Codeの正確なパラメータ数、コンテキスト、および価格については、当社のKimi K2.7 Codeとは何かという解説をご覧ください。

K3はコーディング特化のリリースではありません。これは新しいフラッグシップであり、Moonshotの最も高性能な汎用モデルであり、コーディングはその広範な能力セットの中の強力な機能の一つです。したがって、古いコーダーと新しいコーダーを比較しているのではなく、スペシャリストと、コードにも優れたジェネラリストを比較しているのです。この点が移行決定の大部分を占めます。

世代間で実際に何が変わったのか

マーケティングを剥ぎ取って、何が変わったかを紹介します。

スケール:総パラメータ数が約3倍に

K3は2.8兆パラメータのMixture-of-Expertsモデルです。K2.7 Codeを生み出したK2系列は約1兆パラメータクラスに属していたため、K3は総パラメータ数を約3倍にしています。ただし注意点として、MoonshotはK3のアクティブパラメータ数を公開していません。MoEモデルはトークンごとに重みの一部しか実行しないため、「合計2.8兆」が推論コストを決定する数値ではありません。2.8兆を「すべてのリクエストで2.8兆パラメータが発火する」と解釈しないでください。Moonshotが公開したのはアクティベーションパターンであり、次に説明します。

スケールアップだけでなく、新しいアテンションアーキテクチャ

この部分は、単に大きくなっただけでなく、本当に新しいものです。K3は、以下の3つの要素に基づいて構築されています。

Moonshotは、Kimi K2と比較してスケーリング効率が約2.5倍向上したと報告しています。これは単に計算量が増えただけでなく、計算単位あたりの能力が向上したことを意味します。K2世代のモデルであるK2.7 Codeは、この再設計を組み込んでいないため、その差は「より大きい」だけでなく「異なる構築方法」に起因します。

コンテキスト:最大100万トークン

K3は1,048,576トークンのコンテキストウィンドウをサポートします。コーディングのワークフローにおいては、これはエージェントに数個のファイルを供給するのと、実際の大きなリポジトリ、そのテスト、ログの大部分を一度に渡すことの違いを意味します。大規模なリポジトリタスクでK2.7 Codeのコンテキスト上限に達していた場合、これは日常的に最も重要となる可能性のある単一の変更点です。

位置付け:スペシャリストからフラッグシップのジェネラリストへ

K2.7 Codeはコーディング特化のリリースでしたが、K3は「最も高性能な」フラッグシップモデルであり、長期間にわたるエージェント型コーディングにも優れています。Moonshotは、チップ設計タスクでの48時間にわたる単一の実行を含む、困難な多段階問題に対する自律実行を指摘しています。これらの逸話があなたのワークロードに当てはまるかどうかは、信仰するものではなく、テストすべきものです。しかし、その意図は明らかです。K3は、100万コンテキストと新しいアテンション設計が効果を発揮する、長期間実行され状態を保持するエージェントをターゲットにしています。

価格設定:フラッグシップの料金

K3の価格は、キャッシュヒット入力で100万トークンあたり$0.30、キャッシュミス入力で100万トークンあたり$3、出力で100万トークンあたり$15です。入力における10倍の価格差が興味深い点です。多くの呼び出しで大きなシステムプロンプトやリポジトリコンテキストを再利用するエージェント型コーディングのような、キャッシュヒット率が高いワークロードでは、実効入力コストは$3よりも$0.30にずっと近くなります。新しいコンテキストを持つ単発の呼び出しでは、$3の定価を支払います。$15/Mの出力は、割引のないフラッグシップクラスの料金です。キャッシュに関する詳細な計算については、当社のKimi K3の価格設定ガイドをご覧ください。また、K3がタスクごとに厳密に高価であると仮定する前に、K2.7 Codeの料金を確認してください。

Kimi K3 対 Kimi K2.7 Code: 並べて比較

項目 Kimi K2.7 Code Kimi K3
位置付け K2系列のコーディング特化リリース フラッグシップの「最も高性能な」汎用モデル、エージェント型コーディングに強力
世代 K2系列 (K2からK2.6、K2.7 Codeへ) 新K3世代
総パラメータ数 約1兆パラメータクラス (K2系列) 合計2.8兆 (MoE)
アクティブパラメータ数 K2.7 Codeの記事で確認 未公開; 896人のエキスパートのうち16人がアクティブ
アテンション設計 K2世代のアテンション Kimi Delta Attention + Attention Residuals
MoEフレームワーク K2世代のMoE Stable LatentMoE (16/896エキスパート)
コンテキストウィンドウ K2.7 Codeの記事で確認 1,048,576トークン (100万)
モデルID kimi-k2-7-code kimi-k3
API互換性 OpenAI-SDK互換 OpenAI-SDK互換
公称価格 K2.7 Codeの記事で確認 入力 $0.30/$3 (キャッシュヒット/ミス)、出力 $15/M
オープンウェイト K2.7 Codeのカバー範囲を参照 2026年7月27日頃に公開予定
独立した評価 K2.7 Codeのカバー範囲を参照 Artificial Analysis Intelligence Index 57、189モデル中4位
最適な用途 既知のコストでの狭い範囲のコーディング 大規模コンテキスト、長期間にわたる汎用 + コーディング作業

「確認」とマークされたセルに関する注意:私たちは意図的に正確なK2.7 Codeの数値を捏造していません。正確なK2.7の仕様が必要な場合は、当社のKimi K2.7 Codeとは何かという記事とKimi K2.7 Code APIガイドが信頼できる情報源です。K3を比較的に表現することで、比較の公正さを保っています。

K3が最先端に対して実際にどの位置にあるか

「2.8兆パラメータのフラッグシップ」を「新しい最高のモデル」と読み取るのは簡単ですが、ここではベンダーが通常言葉を濁す部分について説明します。Moonshot自身の発表ブログによると、K3はClaude Fable 5とGPT-5.6 Solに劣るとのことです。特定のベンチマークでは競争力があり、一部では優れていますが、全体的な優位性を主張するものではありません。

独立した評価もそれを裏付けています。Artificial AnalysisはK3のIntelligence Indexを57とし、189モデル中4位にランク付けており、出力は1秒あたり約62トークンで、その価格帯としては遅い方です。Moonshotが公開しているコーディングベンチマークでは、優位性を示すというよりは混在した結果です。DeepSWEではK3が67.5に対しFable 5が70.0、Terminal-Bench 2.1ではK3が88.3に対しFable 5が84.6と報告されています。K3は最先端モデルに対して勝ち負けがあり、オープンウェイトモデルとしては強力な結果ですが、過大評価する理由にはなりません。Moonshotの全主張については、公式Kimi K3発表記事をご覧ください。ベンダーと独立機関の評価のギャップについては、当社のKimi K3ベンチマーク分析で詳しく解説しています。

あなたの移行決定に関して、「自身の前身モデルからのステップアップ」は、「すべてのクローズドモデルを凌駕する」という主張とは異なります。どちらも同時に真実です。

K2.7 Codeから移行すべきか、留まるべきか?

あなたのワークロードを以下の質問に順番に当てはめてみてください。

以下のいずれかに該当する場合はK3へ移行してください

以下のいずれかに該当する場合はK2.7 Codeに留まってください

実世界のシナリオ

抽象的なアドバイスだけでは限界があるので、いくつかの具体的な事例を紹介します。

中規模リポジトリ上のCIコード修正ボット。 K2.7 Codeで既にテストに合格し、費用も抑えられているのであれば、K3は必要ないでしょう。タスクが限定的で、コンテキストが収まり、実行あたりのコストが重要です。現状維持で構いません。失敗率が上昇した場合にのみ再検討してください。

大規模モノレポ上の自律リファクタリングエージェント。 K3の得意分野です。100万トークンのコンテキストにより、コードベース、テスト、ログのより多くを一度に読み込むことができ、長期間にわたる設計は、多くのステップで多数のファイルに触れる実行のために構築されています。実際に試す価値があります。

実践的なセットアップについては、当社のKimi K3コーディングウォークスルーとKimi K3 APIガイドで、モデルの選択とOpenAI互換のクイックスタートについて説明しています。古い系列をまだ使用している場合は、K2.6解説が系列の情報を補完します。

コミットする前に2つのモデルをA/Bテストする方法

決定する最も明確な方法は、同じリクエストを両方のモデルに実行し、その違いを読み取ることです。どちらもOpenAI-SDK互換であるため、ほとんど手間はかかりません。

モデルをkimi-k2-7-codeに設定してMoonshotエンドポイントに1つのリクエストを送信し、次にkimi-k3に設定した2つ目の同一リクエストを送信します。それ以外の要素はすべて固定してください:同じシステムプロンプト、ユーザーメッセージ、温度、ツールです。そして、あなたの決定を左右する以下の3つの要素を比較します。

  1. 出力品質:実際のプロンプトに対する出力品質。直感ではなく、プロダクション出力を評価する方法で判断します。
  2. レイテンシー:K3は独立した速度評価によると遅いモデルであるため、インタラクティブなアプリでは品質向上のメリットを上回る可能性があります。
  3. トークン消費量:キャッシュヒット率が2つのモデル間で実効入力コストをどのように変化させるかを含みます。

Apidogを使えば、この並行ワークフローは簡単です。両方のリクエストを1つのプロジェクトに保存し、モデルIDを環境変数として切り替え、サーバー送信イベントのストリーミング応答をリアルタイムで確認し、ツール呼び出しのペイロードを検査し、呼び出しごとのトークン使用量を確認できます。リクエストを複製し、1つのフィールドを変更するだけで、捨てコードなしで管理されたA/Bテストが可能です。セットアップにはApidogをダウンロードし、エディタで作業する場合は、VS Code内のApidog統合がコードの隣で利用できます。これはマーケティングではなく、証拠に基づいて決定するための無料の方法です。

結論

K3は、K2.7 Codeに対する単なる改名ではなく、真の世代的飛躍です。総パラメータ数を約3倍の2.8兆に増やし、新しいアテンションアーキテクチャ(Kimi Delta Attention、Attention Residuals、Stable LatentMoE)を搭載し、コンテキストを100万トークンに拡張し、製品をコーディングのスペシャリストからフラッグシップのジェネラリストへと再定義しました。また、定価は高くなり、Moonshot自身の認める通り、Fable 5とGPT-5.6 Solにはまだ劣るため、アップグレードは自動ではありません。コンテキスト、一般的な推論、または長期間にわたるエージェントの挙動が必要な場合は、移行してください。K2.7 Codeが既にあなたの基準を満たし、納得できる価格であるならば、留まることは正当化されます。両方を自身のプロンプトで実行し、違いを読み取り、証拠に基づいて選択してください。

ダウンロード

よくある質問

コーディングにはどちらが良いですか? K2.7 Codeはコーディングに特化して調整されており、狭い範囲のコードタスクには強力で費用対効果の高い選択肢です。K3はフラッグシップのジェネラリストであり、長期間にわたるエージェント型コーディングにも優れ、はるかに大きなコンテキストを持ちます。大規模リポジトリでの多段階のエージェント作業にはK3が構造的に優位ですが、K2.7でうまく処理できる狭い範囲のコーディングには、K2.7 Codeがより賢い選択となり得ます。

Kimi K3はK2.7 Codeよりも高価ですか? K3の価格は、キャッシュヒット入力が$0.30/M、キャッシュミス入力が$3/M、出力が$15/Mであり、フラッグシップクラスです。タスクあたりのコストが高くなるかどうかは、キャッシュヒット率と出力の冗長性によって異なるため、ご自身のワークロードで実効コストを比較してください。両モデルともOpenAI-SDK互換であるため、切り替えは主にモデルIDの変更とプロンプトの再テストで済みます。

Kimi K3はオープンソースですか? リリース時点では違います。Moonshotによると、完全なモデルウェイトは2026年7月27日頃に公開される予定です。それまでは、K3はAPIおよびアプリのみで利用可能です。自己ホスティングの計画は、そのリリースに依存するものとして扱ってください。

K3はClaude Fable 5やGPT-5.6 Solよりも優れていますか? Moonshot自身のブログによると、そうではありません。特定のベンチマークでは競争力があったり優れていたりするものの、K3は全体的に両者に劣ります。独立した評価では、Artificial AnalysisはK3のIntelligence Indexを57とし、189モデル中4位にランク付けています。強力なオープンウェイトの候補ではありますが、断然の最先端リーダーではありません。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる