Kimi K3がフロントエンドコードアリーナでトップに、GPUコンパイラを構築、48時間でチップを設計

月の暗面(Moonshot AI)は、長時間のコーディング、知識作業、視覚推論、およびエージェントベースのワークフロー向けに設計されたネイティブマルチモーダルモデル Kimi K3 を発表しました。 このモデルは 2.8兆の総パラメータ数、100万トークンのコンテキストウィンドウ、および高度にスパースな混合専門家アーキテクチャを備えており、各トークンに対して896の専門家から16のみを活性化します。月の暗面はこれを初のオープンな3T級モデルと説明していますが、同社の発表によると、完全なモデルウェイトは 2026年7月27日 にリリースされる予定です。 Kimi K3は、フロントエンド開発、自律型GPUカーネル最適化、MiniTritonと呼ばれる小型GPUコンパイラの作成、およびオープンソースの電子設計自動化ツールを使用して48時間で完了したチップ設計実験などの成果により、すぐに注目を集めています。 月の暗面はまた、K3がすべてのカテゴリーでリードしているわけではないことを認めています。同社の自己評価によると、このモデルは全体的なパフォーマンスでClaude Fable 5およびGPT-5.6 Solに劣るものの、複数のコーディングおよび長時間エージェントタスクでより優れた結果を示しています。 画像は記事で共有されているArtificial Analysisのインテリジェント比較を示しており、Kimi K3の位置を示しています。 Kimi K3は、月の暗面のAPI価格を初期のKimiコーディングモデルよりも高いレベルに押し上げました。 元のレポートの価格表には、中国地域API向けの以下の料金が記載されています: | モデル | キャッシュヒット入力 | キャッシュミス入力 | 出力 | |-|-|-|-| | Kimi K3 | 百万トークンあたり¥2 | 百万トークンあたり¥20 | 百万トークンあたり¥100 | | Kimi K2.7 Code | 百万トークンあたり¥1.30 | 百万トークンあたり¥6.50 | 百万トークンあたり¥27 | 元記事によるKimi K3とKimi K2.7 Codeの価格比較。 月の暗面の国際APIプラットフォームに記載されているKimi K3の価格は以下の通りです: - キャッシュヒット入力:百万トークンあたり$0.30

发布于 2026年7月19日generalGEO 评分: 02 次阅读
画像は深い黒を基調とし、左側に「KIMI MOONSHOT AI」のぼやけた文字、右側に大きな「Kimi K3」の文字、その下に「Frontend Leader · GPU Compiler · 48-Hour AI Chip」と表示されています。中央には発光するチップがあり、チップ上には「K」の文字があります。右側にはフローチャートがあり、「IR」から「Optimize」「Lowering」「CodeGen」などの手順が順に進みます。左側にはコードインターフェースが表示されています。この画像はドキュメント内の「SEOカバーサマリー」に関連し、月の暗面のKimi K3の技術カバーデザインであり、ドキュメントのカバーに対する記述要件を満たしています。

Kimi K3がフロントエンドコードアリーナでトップに、GPUコンパイラを構築、48時間でチップを設計

はじめに

月の暗面(Moonshot AI)は、長時間のコーディング、知識作業、視覚推論、およびエージェントベースのワークフロー向けに設計されたネイティブマルチモーダルモデル Kimi K3 を発表しました。

このモデルは 2.8兆の総パラメータ数100万トークンのコンテキストウィンドウ、および高度にスパースな混合専門家アーキテクチャを備えており、各トークンに対して896の専門家から16のみを活性化します。月の暗面はこれを初のオープンな3T級モデルと説明していますが、同社の発表によると、完全なモデルウェイトは 2026年7月27日 にリリースされる予定です。

Kimi K3は、フロントエンド開発、自律型GPUカーネル最適化、MiniTritonと呼ばれる小型GPUコンパイラの作成、およびオープンソースの電子設計自動化ツールを使用して48時間で完了したチップ設計実験などの成果により、すぐに注目を集めています。

月の暗面はまた、K3がすべてのカテゴリーでリードしているわけではないことを認めています。同社の自己評価によると、このモデルは全体的なパフォーマンスでClaude Fable 5およびGPT-5.6 Solに劣るものの、複数のコーディングおよび長時間エージェントタスクでより優れた結果を示しています。

画像は記事で共有されているArtificial Analysisのインテリジェント比較を示しており、Kimi K3の位置を示しています。

より高価なKimiモデル

Kimi K3は、月の暗面のAPI価格を初期のKimiコーディングモデルよりも高いレベルに押し上げました。

元のレポートの価格表には、中国地域API向けの以下の料金が記載されています:

モデル キャッシュヒット入力 キャッシュミス入力 出力
Kimi K3 百万トークンあたり¥2 百万トークンあたり¥20 百万トークンあたり¥100
Kimi K2.7 Code 百万トークンあたり¥1.30 百万トークンあたり¥6.50 百万トークンあたり¥27

元記事によるKimi K3とKimi K2.7 Codeの価格比較。

月の暗面の国際APIプラットフォームに記載されているKimi K3の価格は以下の通りです:

  • キャッシュヒット入力:百万トークンあたり$0.30
  • キャッシュミス入力:百万トークンあたり$3.00
  • 出力:百万トークンあたり$15.00

これはKimi K2.7 Codeよりもはるかに高価ですが、月の暗面が発表比較で引用したClaude Fable 5の価格よりも依然として低くなっています。

価格比較表は、Kimi K3の出力価格がClaude Fable 5の提示価格のわずか30%であることを示しています。

価格比較を読む際には注意が必要です。API料金は地域、ベンダー、キャッシュ動作、およびその後の製品アップデートによって異なる場合があります。デプロイメント前には、公式のKimi APIページが現在の課金基準を確認する最良の方法です。

Kimi K3がフロントエンドコードアリーナで首位を獲得

最も注目すべき初期の成果はフロントエンド開発分野から来ています。

本稿執筆時点で、Kimi K3は Arenaフロントエンドコードアリーナの暫定WebDevリーダーボード で首位を獲得しています。元のグラフは76%の勝率を示しており、Claude Fable 5およびGPT-5.6 Solをリードしています。

Kimi K3は、レポートで提示された暫定フロントエンドコードアリーナ結果で首位を獲得しています。

7つのフロントエンドカテゴリーのうち、元のレポートではK3が6つのカテゴリーで首位を獲得したとされています:

  1. ブランド・マーケティングウェブサイト
  2. 参照画像デザイン
  3. データ分析インターフェース
  4. 消費者向け製品
  5. シミュレーション・シミュレーション
  6. コンテンツ作成ツール

ゲームカテゴリーでは2位だったと報告されています。

これらの結果は、フロントエンド作業が単なるコード生成の問題ではないため、特に重要です。有能な大規模モデルは、視覚的な要件を解釈し、機能的なアプリケーションを作成し、それを実行し、結果を確認し、インターフェースが期待されるデザインと一致しない場合に実装を修正できなければなりません。

ブラウザベースのmacOSスタイルインターフェースの再構築

元の記事で引用されている例の1つは、エージェントクラスターを使用して約6時間でmacOS 27スタイルのインターフェースを再現したことです。

その結果は、単なる静止スクリーンショットではありません。レポートによると、ブラウザや電話機能などのいくつかの例外を除いて、ほとんどのデスクトップアプリケーションとインタラクションが正常に機能しました。

エージェントによって生成された、最新のデスクトップオペレーティングシステムを模倣したブラウザインターフェース。

その他のデモには、ロボットアームシミュレーターや、Three.jsとWebGPUを使用した完全プログラムベースのブラウザ内3Dゲームも含まれています。

これらの例は依然としてデモンストレーションであり、標準化されたベンチマークではありませんが、MoonshotがK3でサポートしたいワークフローのタイプ(長時間実行、視覚的、反復的なソフトウェア作成)を示しています。

ループ内の視覚

MoonshotはK3のフロントエンドワークフローを ループ内の視覚 と説明しています。

このモデルはコードを一度生成して停止するのではなく、以下のことが可能です:

  1. アプリケーションコードの作成または修正。
  2. プロジェクトの実行。
  3. リアルタイムのスクリーンショットまたはレンダリング結果の確認。
  4. レイアウト、色、階層、またはインタラクションの問題の検出。
  5. コードの修正。
  6. 更新された結果の再レンダリングと上記手順の繰り返し。

このプロセスは、コード生成と視覚的評価の間のギャップを埋めます。

モデルは構文的に有効なHTML、CSS、JavaScriptを生成するかもしれませんが、それでもインターフェースが悪くなる可能性があります。レンダリング出力を観察することで、K3はソースコードだけでは発見しにくい問題を特定できます。

より大きなフロントエンドリポジトリの場合、100万トークンのコンテキストウィンドウも重要です。これにより、多数のコンポーネント、型定義、デザインシステムルール、プロジェクトドキュメント、およびファイル間の依存関係を1つの作業コンテキストに収容できます。

元の記事ではトレードオフも言及されています。一部のユーザーは、複雑なフロントエンドタスクに20分から1時間かかると報告しています。これらは個々の観察であり、制御された遅延測定ではありませんが、K3が

長時間反復型プロセスを優先し、即時出力には重きを置かない傾向

プログラミングベンチマークと長期間エンジニアリング

プログラミングはKimi K3の中核的な強みの一つです。

元のレポートのベンチマーク表には、以下の結果が示されています。

ベンチマーク Kimi K3 Claude Fable 5 GPT-5.6 Sol
DeepSWE 67.5 70.0 73.0
Program Bench 77.8 76.8 77.6
SWE Marathon 42.0 35.0 39.0

画像は、複数のコーディングおよびソフトウェアエンジニアリング評価におけるKimi K3のパフォーマンスを示しています。DeepSWE、Terminal Bench 2.1、Program Bench、SWE Marathonなどのベンチマークスコアが含まれており、例えばDeepSWEではKimi K3が67.5点、Claude Fable 5が70.0点、GPT-5.6 Solが73.0点、Terminal Bench 2.1ではKimi K3が88.3点、GPT-5.6 Solが88.9点などです。この画像は文脈と密接に関連しており、様々な評価におけるKimi K3のスコアを視覚的に示し、読者がコーディングおよびソフトウェアエンジニアリング分野での性能を理解するのに役立ちます。

複数のプログラミングおよびソフトウェアエンジニアリング評価における、Kimi K3の報告結果。

Kimi K3の公式ブログでは、重要な方法論の説明が提供されています。

DeepSWEに関して、Moonshotは主要な比較においてKimi Codeフレームワークの結果を報告していますが、公開されているmini-SWE-agentのランキング結果は67.3とされています。したがって、フレームワークや評価設定の違いにより、わずかな差異が生じる可能性があります。

SWE Marathonに関して、Moonshotは公式タスクのH20キャリブレーションブランチを使用しました。同社はまた、Claude Fable 5が一部の評価でフォールバック動作を示し、それが測定スコアを低下させた可能性があると指摘しています。

これらの詳細は結果を否定するものではありませんが、モデルを比較する際には重要です。エージェントフレームワーク、ツールの権限、ハードウェア、推論設定、フォールバック動作、タスクキャリブレーションのすべてが最終スコアに影響を与える可能性があります。

自律型GPUカーネル最適化

Moonshotは、Kimi K3が人間の監督を最小限にしてGPUカーネルを最適化できるかどうかをテストしました。

各モデルには同一のサンドボックス環境が与えられ、最大24時間以内に以下の関連カーネルの分析、書き換え、ベンチマーク、最適化を完了することが求められました。

  • Attention Residuals
  • Kimi Delta Attention
  • 512ヘッド次元のMLAワークロード
  • 別のベンダー製汎用GPU

NVIDIAテストはH200ハードウェア上で実行されました。

AttnRes最適化

Attention Residualsワークロードについて、原文はK3が新しい2段階カーネルアルゴリズムを考案し、それにより

順方向および逆方向実行の合計時間が 283.6ミリ秒から114.4ミリ秒に短縮 されたことを示しています。

これはベースラインと比較して約59.7%の高速化に相当し、Moonshotの実験構成においてKimi K3はClaude Fable 5のスコアに迫りました。

画像は、Attention Residuals(AttnRes)タスクにおけるKimi K3の最適化軌跡を示しています。横軸はアクティブ時間(時間)、縦軸は高速化率です。図では、異なる色の線でKimi K3、Claude Fable 5、GPT 5.5+、GPT 5.6 Solなどのモデルの最適化状況を示しています。Kimi K3の赤い線は、高速化率が0%から徐々に59.7%まで上昇し、Claude Fable 5の57.1%に近づいていることを示しています。この図は文脈と密接に関連しており、AttnResタスクにおけるKimi K3の最適化効果の時間経過に伴う傾向を視覚的に示しています。

AttnResカーネルタスクにおける、Kimi K3の報告された改善軌跡図。

この図は、エージェントが時間の経過とともに改善していく様子も示しています。K3は実行の初期段階で複数の大きな進歩を遂げ、その後の反復を通じてカーネルを継続的に最適化しました。

MLA-512カーネル

ゼロからのMLA-512タスクにおいて、Kimi K3のカーネルは、順方向と逆方向の複合負荷下で、報告された 517.8 TFLOPS を達成しました。

報告で示された2番目に高い結果は約492.7 TFLOPSでした。

画像は、様々なモデル最適化タスクにおけるKimi K3のTFLOPS(1秒あたり1兆回の浮動小数点演算)パフォーマンスを示しています。横軸はアクティブ時間(時間)、縦軸はTFLOPSです。図では、異なる色の線でAttnRes、DSA、MLA、KDA - GP GPUの4つのタスクの最適化状況を示しており、Kimi K3はMLAタスクで517.8 TFLOPSと顕著な成績を収め、他のモデルを大きく上回っています。図にはClaude Fable 5、Claude Opus、GPT 4.8、GPT 5.5、GPT 5.6などのモデルのTFLOPS値も記されています。この図は文脈と密接に関連しており、MoonshotのテストにおけるKimi K3の最適化タスクのパフォーマンスを視覚的に示しています。

MLA-512最適化タスクにおいて、報告された517.8 TFLOPSを達成したKimi K3。

Moonshotは、モデル開発の後期段階では、初期バージョンのK3がチームのカーネル最適化作業の大部分を担っていたと述べています。これは同社が自己申告したワークフローであり、ソースにリンクされた資料において独立した審査を受けたものではありません。

MiniTriton:ゼロから構築されたGPUコンパイラ

次の実験は、個々のカーネルの最適化を超えたものでした。

Moonshotは、Kimi K3がゼロから小型のGPUプログラミングシステムを構築できるかどうかを探求しました。その成果が MiniTriton であり、Tritonに似たコンパクトなコンパイラで、以下を含みます。

  • 独自のタイルレベルの中間表現
  • MLIR上に構築されたIR層
  • 最適化プロセス
  • PTXコード生成パイプライン
  • 生成されたカーネルのランタイムサポート

Moonshotは、MiniTritonがサポートされているルーフラインベンチマークにおいて、特定のワークロードではTritonを上回るなど、Tritonおよび torch.compile のパフォーマンスに達するか、それを超えたと報告しています。

![画像は、NVIDIA L20(sm_89)GPU上でのMiniTritonのCUDAコア ルーフラインパフォーマンスを示しています。横軸は演算強度(FLOP/バイト)、縦軸は達成パフォーマンス(GFLOPS)です。図では、異なる色と形状の点で、torch.eager、torch.compile、minitritonなどの異なるコンパイラのパフォーマンスデータが示されており、例えばtorch.compileは10^1の点で37.2 TFLOPSに達しています。また、異なるタイルサイズ(BT)とタイル数(T)におけるパフォーマンスポイントも記されています(例:BT=16で10^1の点において1024 GFLOPS)。この図は文脈と密接に関連しており、MiniTritonのパフォーマンスを視覚的に示しています。](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/07/664fc2e9-1b2c-459d-b907-898ed77df1af-2b65c54f-ba91-475a-81e6-9a3472a15637.png)

MiniTriton が NVIDIA L20 GPU 上で報告した CUDA コアのルーフラインパフォーマンス。

このコンパイラは、エンドツーエンドの nanoGPT トレーニングもサポートし、安定した収束を実現しています。Moonshot によると、損失曲線は参照実装と近い値を保ち、わずかなずれしか生じていません。

これは、孤立したマイクロベンチマークによる評価よりも意味のある結果です。生成されたシステムが、フロントエンド言語、中間表現、最適化パイプライン、PTX 生成、ランタイムを一貫したワークフローに統合できることを示しています。

ただし、本稿執筆時点では、Moonshot は MiniTriton のコードベースを公開していません。そのため、パフォーマンスの主張は Kimi K3 の発表資料に基づいており、公開されたコードによる再現はまだ不可能です。

48時間の自律実行で設計されたチップ

Kimi K3 はチップ設計においてもテストされました。

48時間の自律実行中に、このモデルはオープンソースの EDA ツールと Nangate 45nm プロセス設計キットを使用して、K3 アーキテクチャに基づく小規模モデルを処理するためのチップを構築、最適化、検証しました。

Moonshot は以下のシミュレーション設計結果を報告しています。

  • 面積は 4 mm² 未満
  • 146万 の標準セル
  • 0.277 MB の SRAM
  • 100 MHz でのタイミング収束
  • シミュレーションでのデコードスループットは 毎秒8700トークン 以上
  • 融合逆量子化を備えた INT4 乗算加算アレイ

画像は、Kimi K3が48時間の自律実行中に設計したチップのシミュレーション結果を示しています。画面には「10 LGWR read pipe」などの複数のモジュールが表示され、各モジュールには番号が付いています。右上には「8358 tps」などの情報が表示され、毎秒8358トークンを処理していることを示しています。この画像は、ドキュメント内のKimi K3が48時間の自律実行中にオープンソースEDAツールとNangate 45nmプロセスを使用してチップを設計した内容に関連し、設計結果を視覚的に示しています。

このチップ設計のケーススタディでは、シミュレーションで毎秒8700トークン以上の処理速度が報告されています。

検証されたデジタル設計と実際に製造された物理チップの違いは重要です。

公開されている資料には、EDA 設計、最適化、タイミング、シミュレーションの演習について記載されています。これらは、チップがテープアウト、製造、パッケージングされ、シリコン上でテストされたことを示すものではありません。

この制限があるとしても、拡張されたハードウェア設計パイプラインを完了することは、注目すべき長期コーディングの事例です。エージェントがアーキテクチャの決定、ハードウェア記述、合成、配置配線、タイミング検証、検証、反復的な最適化の間で協調して動作する必要があります。

2.8T 規模を支える2つの中核的イノベーション

Kimi K3 は、Moonshot AI が開発した2つの技術に基づいています。

  1. Kimi Delta Attention
  2. Attention Residuals(アテンション残差)

このモデルは、これらの技術を、より活性化が疎な混合エキスパートアーキテクチャと組み合わせています。

画像は、Kimi K3のアーキテクチャを示しており、3つの部分に分かれています。左側はStable LatentMoEとKDAモジュールで、共有エキスパート、ルーター、線形層、正規化層などが含まれます。中央はAttnRes操作で、線形層、正規化層、KDAなどがあります。右側はBlock Attention Residualsのバックボーンで、Stable LatentMoE、Gated MLA、Stable LatentMoE、KDAなどのモジュールがあります。この図はコンテキストに密接に関連し、Kimi K3モデルにおけるStable LatentMoE、KDA、AttnResなどのキーコンポーネントの構造を視覚的に示し、長いシーケンスの効率的な処理、情報の柔軟な伝達、疎な活性化などの特性を理解するのに役立ちます。

Kimi K3 は、KDA、アテンション残差、Gated MLA、Stable LatentMoE を組み合わせています。

Kimi Delta Attention

Kimi Delta Attention、略して KDA は、アテンション機構を長いシーケンスに対してより効率的にすることを目的としています。

KDA は、コンテキスト全体にわたる標準的なフルアテンションに完全に依存するのではなく、エンコーディング、推論、エージェントタスクに必要な情報を保持しながら、長い入力を処理するための効率的なメカニズムを提供します。

これは、K3 モデルの数百万トークンのコンテキストウィンドウを支える基盤の1つです。

アテンション残差機構

従来の Transformer 層は、新しい各層の出力を累積された隠れ状態に繰り返し追加します。

**アテンション残差機構(AttnRes)**は、このパターンを変更します。これにより、後続の層は、すべての初期層を単一の累積フローの一部として扱うのではなく、異なる深さから表現を選択的に取得できるようになります。

月之暗面(Moonshot AI)は、これを超深度モデルにおける情報フローを実現する、より柔軟な方法であると説明しています。

安定潜在MoEアーキテクチャ

Kimi K3 は 896個のエキスパートモジュール を持ちますが、各トークンは 16個のエキスパート のみを活性化します。

この極度の疎性は、モデル全体のサイズと比較してトークンあたりの計算量を削減する一方で、ルーティングと負荷分散の難易度を高めます。月之暗面の安定潜在MoEフレームワークは、このような疎な構成下でのトレーニングの安定性を維持することを目的としています。

分位数均衡

混合エキスパートモデルは、一部のエキスパートに過剰な負荷がかからないように、トークンをエキスパート間で適切に分散する必要があります。

K3 は 分位数均衡 技術を採用しており、手動で調整されたバランス戦略に依存するのではなく、ルータースコアの分位数に基づいてエキスパートを割り当てます。月之暗面は、これにより敏感な負荷分散ハイパーパラメータが不要になり、大規模なエキスパート割り当てがより安定すると述べています。

ヘッド単位オプティマイザ

K3 は Muon オプティマイザを拡張し、ヘッド単位の Muon 最適化 を実現しています。

このアプローチは、アテンションパラメータを独立した構造に分解し、各アテンションヘッドを個別に最適化します。目標は、大規模トレーニングにおいて、各アテンションヘッドにより適応的な最適化動作を提供することです。

SiTU と Gated MLA

2つの追加コンポーネントが活性化とアテンション制御をサポートします。

  • Sigmoid Tanh ユニット(SiTU) は活性化制御を改善します
  • Gated MLA はアテンション選択の柔軟性を高めます

KDA、AttnRes、安定潜在MoE、分位数均衡、ヘッド単位Muonを組み合わせることで、月之暗面はこれらの改善により、Kimi K2 と比較して全体的なスケーリング効率が約 2.5倍 向上したと述べています。

量子化対応トレーニングと推論アーキテクチャ

Kimi K3 は、教師ありファインチューニングの段階から量子化対応トレーニングを採用しています。

公式テクニカルブログには以下が記載されています。

  • MXFP4 重み
  • MXFP8 アクティベーション

目標は、この規模のモデルのトレーニングとデプロイ可能性を維持しつつ、さまざまなアクセラレータハードウェア間の互換性を向上させることです。

月之暗面は同時に、効率的な推論のために 64個以上のアクセラレータ を使用するスーパーノードデプロイメントを推奨しています。これは、オープンウェイトが容易なローカルデプロイを意味するわけではないことを明確に示しています。この2.8兆パラメータモデルは、依然として大規模なインフラストラクチャシステムです。

KDA プレフィックスキャッシュ機構

KDA は、従来のプレフィックスキャッシュに新たな課題をもたらします。

月之暗面は、対応するプリフィルキャッシュ実装を開発し、vLLM エコシステムに貢献したと述べています。その公式 API は、コード関連のワークロードにおいて90%以上のキャッシュヒット率を達成しています。

このキャッシュ層は、キャッシュありとキャッシュなしの入力間の価格の大きな差を説明しています。この実装はモデルと同時にオープンソース化され、開発者は Kimi と vLLM の公式発表を確認できます。

現在の可用性と統合ステータスのコードリポジトリです。

既知の制限事項

月之暗面は、Kimi K3 の3つの重要な制限事項を挙げています。

思考履歴への敏感性

K3 のトレーニングパターンは、モデルの以前の思考履歴を保持します。

エージェントフレームワークが期待される完全な履歴を返さない場合、生成品質が不安定になる可能性があります。ユーザーがアクティブなセッションの途中で他のモデルから切り替えた場合、

K3でも同様の問題が発生する可能性があります。

月之暗面は、検証済みの互換ツール(Kimi Codeなど)の使用を推奨しており、セッション途中でのモデル切り替えを避けるよう注意を促しています。

過度な積極性

K3は、長時間・高難度のタスクに対して大規模なトレーニングを受けています。

そのため、小さな問題や曖昧な指示に過剰に反応し、ユーザーが予期しない判断を下す可能性があります。

厳格な境界設定が必要なアプリケーションでは、システムプロンプトまたは AGENTS.md ファイル内で、それらの境界を明確に定義する必要があります。

ユーザー体験の差

月之暗面は、Claude Fable 5やGPT-5.6 Solと比較して、K3には依然として明らかなユーザー体験の差があると述べています。

この限定的な条件は貴重です。ベンチマークスコアや自律エンジニアリングのデモだけでは、応答の一貫性、レイテンシ、指示の解釈、ツールの信頼性、会話の流暢さなど、プロダクション体験のすべての側面を網羅することはできないからです。

利用可能性とオープンウェイトの状況

Kimi K3は、以下のチャネルから利用可能です。

リリース時、K3はデフォルトで最大思考強度を使用します。月之暗面は、今後のアップデートで低い思考強度と高い思考強度のオプションを追加すると述べています。

同社は、完全なモデルウェイトを2026年7月27日までに公開すると発表しています。これらのウェイトとテクニカルレポートが公開されるまでは、一部のアーキテクチャ、ベンチマーク設定、MiniTriton実装、およびチップ設計フローは、月之暗面が公開した説明に依存しています。

画像は、2025年7月から2026年10月までの各社のフラッグシップモデルにおける、オープンフロンティアモデルのパラメータ数の変化を示しています。横軸は時間軸、縦軸は総パラメータ数です。図では、Moonshot AI、Xiaomi、Alibabaなど、異なる企業が異なる色の線で識別されています。Kimi K3は2026年7月に2.8兆パラメータに達し、現時点での最大値です。この図はコンテキストと密接に関連しており、Kimi K3のパラメータ数における優位性と、他の大規模モデルとのパラメータ数の比較を視覚的に示しています。

Kimi K3は、月之暗面が報告したオープンモデルの規模を2.8兆パラメータにまで引き上げました。

よくある質問

Kimi K3とは何ですか?

Kimi K3は、月之暗面AIが開発した2.8兆パラメータのネイティブマルチモーダルモデルであり、長期にわたるコーディング、ナレッジワーク、ビジュアル推論、エージェントタスクに適しています。100万トークンのコンテキストウィンドウをサポートし、トークンごとに896個のエキスパートのうち16個を活性化します。

Kimi K3はオープンソースですか?

月之暗面はK3をオープンな3T級モデルと呼び、完全なモデルウェイトを2026年7月27日までに公開すると発表しています。本稿執筆時点では、K3の完全なウェイト公開とテクニカルレポートは完了していません。

Kimi K3 APIの費用はいくらですか?

国際的なKimi APIの価格は次のとおりです:キャッシュされた入力トークン100万あたり0.30ドル、キャッシュされていない入力トークン100万あたり3.00ドル、出力トークン100万あたり15.00ドル。価格は変動する可能性があります。

そのため、プロダクションユーザーは公式APIプラットフォームで現在の料金を確認する必要があります。

Kimi K3のフロントエンドコーディング能力は本当に世界一ですか?

Kimi K3はリリース時にArena WebDevランキングで暫定的に1位になりました。より多くの投票とモデルが追加されるにつれてランキングは動的に変化するため、最新のランキングはリアルタイムのArenaページを参照してください。

MiniTritonとは何ですか?

MiniTritonは、月之暗面によればKimi K3がゼロから構築したコンパクトなGPUコンパイラです。これには、MLIRベースのタイルレベルの中間表現、最適化パス、PTXコード生成パイプラインが含まれており、エンドツーエンドのnanoGPTトレーニングをサポートします。

Kimi K3は物理的なチップを製造しましたか?

物理的なテープアウトに関する公式情報は公開されていません。月之暗面は、Nangate 45nmライブラリを使用してチップ設計、最適化、検証、シミュレーションを完了する48時間の自律型電子設計自動化(EDA)実行について説明しています。

Kimi K3はローカルで実行できますか?

このモデルは非常に大規模であり、月之暗面は、推論のためのデプロイメント構成には効率的な実行のために少なくとも64個のアクセラレータが必要であると推奨しています。ウェイトが公開された後でも、ローカル実行には大規模な専用インフラストラクチャか、大幅に改造されたデプロイメントソリューションが必要です。

Kimi K3の主な制限は何ですか?

月之暗面は、保持思考履歴に対する感度、曖昧なタスクにおける過度の積極性、そしてClaude Fable 5やGPT-5.6 Solと比較したユーザー体験の差を指摘しています。明示的なエージェント制約と互換性のある適応フレームワークの使用が推奨されます。

関連ツール

  • Kimi:月之暗面のエージェントワークスペース。コーディング、リサーチ、ドキュメント、スライド、ビジュアライゼーションワークフローでKimi K3を使用できます。
  • Kimi Code:月之暗面がオープンソース化したターミナルコーディングエージェントであり、推奨されるK3互換適応フレームワークです。
  • Kimi APIプラットフォームkimi-k3や他のKimiモデルにアクセスするための公式APIサービスです。
  • Arena WebDevリーダーボード:フロントエンドおよびウェブ開発モデル向けのリアルタイムコミュニティ投票リーダーボードです。
  • Triton:高性能GPUカーネルを記述するためのオープンソースの言語およびコンパイラです。
  • MLIR:中間表現と最適化パイプラインを構築するための、LLVMの再利用可能なコンパイラインインフラストラクチャです。
  • vLLM:高スループットの推論とプレフィックスキャッシングをサポートするオープンソースの大規模言語モデル推論エンジンです。
  • OpenROAD:自動化されたチップ設計フローに関連するオープンソースのRTL-to-GDSIIツールチェーンです。

関連リンク

  • Kimi K3公式テクニカルブログ:アーキテクチャ、コーディング事例、価格、利用可能性、評価、制限を網羅した月之暗面の発表記事です。
  • Kimi K3 APIプラットフォーム:現在のK3 APIアクセスと価格に関する公式情報源です。
  • Kimi Code GitHubリポジトリ:公式コーディングエージェントリポジトリとインストールドキュメントです。
  • Arena WebDevリーダーボード:現在のフロントエンドモデルのランキングと投票データです。
  • DeepSWEリーダーボード:月之暗面の評価レポートで引用されている公開ソフトウェアエンジニアリングベンチマークです。
  • Program Bench:K3のコーディング比較で使用されたプログラミングベンチマークです。
  • SWE Marathon:月之暗面が引用する長期ソフトウェアエンジニアリングベンチマークです。

概要

Kimi K3は、月之暗面がこれまでに公開した中で最大のモデルであり、総パラメータ数は2.8兆です。

8兆パラメータ、ネイティブなマルチモーダル入力をサポートし、100万トークンのコンテキストウィンドウを備え、896のエキスパートの中から16個をスパースに活性化する。

最も顕著な初期成果は、長周期エンジニアリング領域で見られた。K3はフロントエンドコードアリーナの初期ランキングで1位となり、GPUカーネルを最適化し、MiniTritonコンパイラを構築し、オープンソースのEDAツールを用いて48時間のアナログチップ設計ワークフローを完了した。

このアーキテクチャは、Kimi Deltaアテンション機構、アテンション残差接続、安定した潜在MoE、分位数バランス、ヘッドごとのMuon最適化器、SiTU、ゲート付きMLAを融合している。月の暗面は、Kimi K2と比較して拡張効率が2.5倍向上したと報告する一方、エージェントとの互換性、積極性、全体的なユーザーエクスペリエンスにおいて重要な限界があることも認めている。

Kimi K3の最も重要な主張は、すべてのベンチマークで勝利したことではなく、異常に長期にわたり、視覚に依存し、ツールチェーンを活用するエンジニアリングタスクにおいて、高い生産性を維持できる点にある。