イベント日:2026年7月16日。 Kimiは、コーディング、推論、知識労働向けに設計された2.8兆パラメーターのマルチモーダルモデル「Kimi K3」を発表した。同社はKimi.com、Kimi Work、Kimi Code、およびAPIを通じてモデルを利用可能にし、2026年7月27日までに完全なウェイトを公開する予定だと述べた。

K3は、所定の計算に対して896個のエキスパートのうち16個を有効化するMixture-of-Experts設計を採用している。Kimiによると、このシステムはKimi Delta Attention、Attention Residuals、Stable LatentMoEフレームワークを組み合わせ、Kimi K2の約2.5倍となる総合的なスケーリング効率を実現する。また、ネイティブの画像処理機能と100万トークンのコンテキストウィンドウも備える。アーキテクチャーとトレーニングの詳細は、後日公開される技術報告書に盛り込まれる予定だった。

同社はK3を、約3兆パラメーター級では初のオープンモデルと説明している。また、同社がテストした中で最も高性能なプロプライエタリシステムには総合性能でなお及ばないことを認める一方、独自の評価スイート全体でフロンティア級の結果を達成したと主張している。ローンチ時点では、ホスト版モデルはデフォルトで最大の思考強度を使用する。より低い強度と高い強度の選択肢は、今後のアップデートで提供される予定だった。

Kimiは、長時間にわたるソフトウェア作業を主要なユースケースとして強調した。同社のデモでは、K3が24時間のサンドボックス環境でGPUカーネルを最適化し、MLIRベースの中間層とPTX生成機能を備えた小型コンパイラー「MiniTriton」を構築した。Kimiによると、MiniTritonは対応するルーフラインテストでTritonおよび`torch.compile`と同等以上の性能を示し、安定した収束を保ちながらnanoGPTのトレーニングを継続した。これらはベンダーが報告した結果であり、より広範な独立機関による再現を待つ必要がある。

別のデモでは、初期版K3に、オープンソースの電子設計ツールを使って小型チップを設計・検証する課題を与えた。Kimiによると、シミュレーション上の設計は4平方ミリメートル以内に収まり、100MHzでタイミングクロージャーを達成し、毎秒8,700を超えるデコードトークンを実現した。別の計算宇宙物理学の事例では、20本を超える論文のレビュー、300を超える状態方程式の評価、3,000行を超えるPythonコードの生成が行われた。

こうしたケーススタディは、個別のプロンプトに回答するのではなく、何時間にもわたってコンテキストを維持し、ツールを使用できるエージェントという目指す方向性を示している。より重要な試験はウェイトの公開後に訪れる。外部の研究者が導入要件を調査し、評価を再現し、実用上の性能を検証できるようになるためだ。それまでは、K3の規模と提供状況はKimiの発表によって示されているものの、比較上の能力については開発元による主張にとどまる。