事象の日付:2026年6月2日。 Microsoftは、一般的なソフトウェア開発作業で応答性の高い支援を提供するよう設計されたコーディングモデル、MAI-Code-1-Flashを発表した。このモデルは、Visual Studio Codeを利用する個人向けGitHub Copilotユーザーへの展開が進められており、モデル選択画面に表示されるか、Copilotの自動ルーティングによって選択される場合がある。
Microsoftによると、このモデルは追跡可能なエンタープライズ級データを使用してゼロから訓練され、第三者のモデルから蒸留したものではない。同社は、実運用のGitHub Copilotハーネスを訓練に組み込んだ。これは、独立したベンチマーク用プロンプトだけに最適化するのではなく、エージェント型コーディングのワークフローで使われるツールやインタラクションをモデルに経験させることを意図した手法だ。
開発中の評価は、ソフトウェアエンジニアリング作業、リポジトリに関する質問、リファクタリング、Copilotの利用状況に基づくテレメトリ情報を反映させたタスクを対象とした。MAI-Code-1-Flashは、解答の長さを適応的に制御する機能も使用する。Microsoftによると、これにより単純な要求には簡潔に答えつつ、より広範なコード変更には多くの推論と出力を割り当てられる。同社は、このモデルがより難しいタスクを最大60%少ないトークンで解決できると報告しており、この結果が実運用でも再現されれば、遅延と提供コストを削減できる可能性がある。
社内テストでは、同じ実運用ハーネスを使用し、SWE-Bench Verified、SWE-Bench Pro、SWE-Bench Multilingual、Terminal Bench 2で、このモデルとClaude Haiku 4.5を比較した。Microsoftは、4つすべてで合格率が上回ったと報告した。最大の成果として強調されたのはSWE-Bench Proで、MAI-Code-1-Flashは51.2%を記録し、Haiku 4.5は35.2%だった。Microsoftはまた、厳密な指示追従テストで28.9ポイント、基準表に基づく高度なテストで14.5ポイント上回ったと報告した。
これらの数値は、ベンダーが報告した比較結果である。ベンチマークの結果は、ハーネス、プロンプト、ツールへのアクセス、採点規則によって変動し得るため、あらゆるリポジトリやプログラミング作業に通用する普遍的な順位と解釈すべきではない。実際に稼働するCopilotセッションへの展開により、信頼性、編集品質、効率性がより幅広く試されることになる。
Microsoftはまた、既知のパズルを改変した問題、実現不可能な要求、情報不足で答えが一意に定まらない状況など、敵対的推論問題34カテゴリーにわたる186問のベンチマークを作成した。同社は、全体の調整後正答率が85.8%だったと報告する一方、一部のアインシュテルング効果のわなに関するカテゴリーでは成績が50%を下回ったと説明した。
対象ユーザーに追加の設定は必要ない。今回のリリースにより、MicrosoftはCopilot内に自社製の効率重視の選択肢を用意する一方、報告された性能向上が自分たちの言語、リポジトリ、レビュー基準でどう再現されるかの評価はユーザーに委ねられる。
Copilotユーザーにとって、モデルが利用可能になったからといって、提案された変更を精査する必要がなくなるわけではない。出力の高速化とトークン数の削減は対話的な作業サイクルを改善し得るが、編集内容が機能することの証拠となるのは、リポジトリ固有のテストと人間によるレビューである。Microsoftの展開によって、自動ルーティングが速度重視の設計に合うタスクでこのモデルを選択し、合わない場合には別のモデルへ切り替えるかどうかも明らかになる。



