XiaomiのMiMo-V2.6-Proは9月21日、テキスト、画像、音声、動画の入力とテキスト出力に対応し、100万トークンのコンテキストウィンドウを備えてモデル市場に登場した。Artificial Analysisによる初期測定では、重みを公開したこの推論モデルは、比較対象群のなかで高速かつ比較的高性能と評価された。一方、入力料金は同評価機関が用いた中央値を上回っている。

モデルはArtificial Analysis Intelligence Indexのバージョン4.3.2で46を記録した。同評価機関によると、同規模の比較対象となる重み公開モデルの中央値は18であり、MiMo-V2.6-Proはこの基準を大きく上回る。複合指数は、分析作業、自動化、コーディング、科学、幅広い知識、長い文脈での推論を扱う複数の評価を基にしている。

この点数は普遍的な順位ではなく、一つのベンチマーク体系による結果として読むべきものだ。Artificial Analysisは、AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCRなどのテストを組み合わせている。用途によって各能力の重要度は大きく異なり、単一の総合値では個別課題の長所や弱点が見えにくくなることがある。

初期評価で目立つのは速度だ。Artificial Analysisは出力速度を毎秒約125トークンと測定し、このモデルの分類では特に高速と評価した。生成速度は最初の応答断片が届いた後を測るため、それだけで利用者が経験する待ち時間全体を表すわけではない。最初のトークンが返るまでの時間、推論時間、提供事業者の条件はいずれも、処理全体の遅延に影響する。

公表料金は入力100万トークン当たり43セント、出力100万トークン当たり87セントだ。評価機関が示した比較では、入力料金は中央値の30セントより高く、出力料金は中央値の1.13ドルより安い。Artificial Analysisによると、Intelligence Indexの評価実行には206.66ドルかかった。これらは標準化した条件下での一時点の数値であり、実際の導入費用はプロンプトと出力の長さ、キャッシュ、処理設計に大きく左右される。

100万トークンのコンテキストウィンドウは、一度のリクエストに投入できる資料の量を増やす。検索拡張システム、長い文書、多数の記録を組み合わせる作業には有用になり得るが、公称容量だけでは、非常に長いプロンプトの各部分をどれほど確実に利用できるかは分からない。文脈の大きさ、検索の質、推論の正確さは別々の性質だ。

Artificial AnalysisはMiMo-V2.6-Proについて、やや冗長だとも説明している。トークン単価が有利に見えても、出力が長ければ費用と遅延は増えるため、応答の長さを適切に制御することが開発者にとって運用上の論点となる。ベンチマークの費用指標には独自のテスト群で生成したトークンが反映されるが、本番システムでは異なる出力傾向になる可能性がある。

初期の数値はMiMo-V2.6-Proを、大容量の文脈を扱え、競争力のあるベンチマーク性能を持つ高スループットのマルチモーダルモデルとして位置づける。ただし、用途ごとの評価が不要になるわけではない。導入を検討するチームは、複合スコアを導入判断につなげる前に、自らのデータで事実の信頼性、指示への追従、長い文脈の活用、総応答時間をなお検証する必要がある。