出来事の日付:2026年7月28日
機械学習研究者セバスチャン・ラシュカによるアーキテクチャー分析によると、Kimi K3は先行するKimi Linearモデルのアイデアを、2.8兆パラメーターのオープンウェイトシステムへと拡張したものだ。彼のレビューでは、推論効率を中心に据え、複数の馴染み深い構成要素を圧縮された、または特化型の代替要素に置き換えた設計だと説明されている。
ラシュカはK3を、480億パラメーターだったKimi Linearを実運用規模へ拡張したものと位置付けている。彼によれば、K3はその所見を記した時点で最大のオープンウェイトモデルだった。この比較は、分析で説明されたモデル全体の規模とリリース時の状況を指すものであり、提供された根拠には品質や展開コストに関する別個のベンチマークは示されていない。
Kimi Linearと比べた主な新要素はLatentMoEである。この仕組みは、ラシュカがマルチヘッド潜在アテンションになぞらえるダウンプロジェクションの手法によって、大規模な線形層を圧縮する。彼は、この概念がNemotron 3 Ultraで使われたLatentMoEに似ていると指摘する。K3では、推論をより効率化する幅広い取り組みの一環として、これがマルチヘッド潜在アテンションおよびKimi Delta Attentionと併用されている。
もう1つの注目すべき仕組みは、Kimi Linearから引き継いだアテンション残差である。通常、残差接続は層を迂回して情報を伝える。ラシュカが説明するアーキテクチャーでは、残差が層をまたいで接続され、アテンションスコアがその接続の重要性または寄与を重み付けする。これは、残差経路を広くしたDeepSeek V4の多様体制約付きHyper-Connectionsの手法とは異なる。
ラシュカが引用した技術報告書によると、アテンション残差は検証損失と下流タスクの性能を一貫して小幅に改善する。この仕組みにはコストも加わり、彼の要約によれば、学習時に約4%、推論時に約2%増加する。これらの数字からは、無償の最適化ではなく、品質と計算量の間で慎重に選択されたものと位置付けられる。
K3はまた、位置埋め込みを使わないことを意味するNoPEをアーキテクチャー全体で採用している。ラシュカはこれを、局所アテンション層では回転式位置埋め込みを、グローバル層ではNoPEを組み合わせるシステムと対比している。彼はK3について、すべての層でRoPEを廃止した、自身の知る限り初のフロンティア級モデルだと説明する一方、より以前にも少数ながらNoPEだけを使用したアーキテクチャーがあったと指摘している。
ネイティブのマルチモーダル対応も新たに追加された。提供された分析には、対応メディア、学習データ、マルチモーダル性能の比較結果に関する詳細がないため、この情報源だけでは実用上の範囲を評価できない。
全体として、このアーキテクチャーは極めて大規模であることと、推論時のオーバーヘッドを抑えるための複数の技術を組み合わせている。潜在混合層と特化型アテンションが効率性に対処する一方、重み付き残差接続は、報告された性能向上と引き換えに小さな計算コストを受け入れている。その結果、構造は複雑になっているが、主要要素は一貫した目標に沿っている。それは、Kimi Linearの基盤を、はるかに大規模なマルチモーダルのオープンウェイトリリースへ適応させることである。



