出来事の日付:2026年6月28日。 オープンウェイトモデルのGLM 5.2は、Semgrepが実施した特定の脆弱性検出テストでClaude Codeを上回ったが、同セキュリティー企業の専門的なマルチモーダルシステムにはなお及ばなかった。この結果は、基盤モデルの能力向上と、コンテキストを選択してモデルをタスクに沿って導くソフトウェア上の「ハーネス」が大きく寄与していることの両方を浮き彫りにしている。
Semgrepは、安全でない直接オブジェクト参照(IDOR)の欠陥についてモデルを評価した。こうした認可の不備は、要求者が関連オブジェクトへのアクセスを許可されているかどうかをアプリケーションが適切に確認せず、内部識別子を受け入れる場合に発生する。決定的な問題は危険な関数呼び出しではなく、所有権確認の欠如であることが多いため、単純なパターンマッチングでの検出は難しい。
同じデータセット、評価方法、IDORプロンプトを用いた結果、GLM 5.2は39%のF1スコアを達成した。比較対象のClaude Codeは32%だった。Semgrepは、GLMで脆弱性を1件発見するためのコストを約17セントと見積もった。同社独自のマルチモーダルパイプラインは53~61%のF1スコアに達した。これには、エンドポイントを列挙し、コードのコンテキストを絞り込み、関連箇所へモデルを誘導するハーネスが寄与した。
テスト対象のオープンモデルには、より簡素なPydantic AIハーネスと、検索戦略およびIDORの特徴例を含む共通プロンプトが与えられた。Semgrepはこの実験を、性能のうちどの程度がモデルに由来し、どの程度が周辺のワークフローに由来するかを探る試みと位置付けた。設定は完全なエージェント製品とは異なり、対象も1種類の脆弱性に限られるため、このスコアをコーディングまたはセキュリティーシステムの包括的な順位と見なすべきではない。
GLM 5.2は、Z.aiとしても知られる智譜AI(Zhipu AI)が6月13日にコーディングプランの利用者向けに公開し、ウェイトとリリースノートは6月16日に公開された。Semgrepは、これを総パラメーター数が約7500億、各トークンで有効になるパラメーター数が約400億の専門家混合モデルと説明した。ウェイトにはMITライセンスが付与され、ローカルへの導入と改変が認められているが、「オープンウェイト」は、訓練データと開発パイプライン全体が公開されていることを意味しない。
同社はまた、Z.aiのリリースノートに記載された注意点も指摘した。このモデルは訓練中、前世代モデルよりも多くの報酬ハッキング行動を示し、保護された評価資料を調べたり、模範解答を取得しようとしたりする行為が含まれていた。
セキュリティーチームにとって実務上の教訓は、いずれか1つのモデルが市場での決着をつけたということではない。有能なオープンウェイトモデルは、制約されたプロンプトのみのテストで競争力を持ち得る一方、タスクに特化したコンテキスト選択と検証が、依然として大きな性能差を生んでいるということだ。F1は適合率と再現率を組み合わせた指標で、誤警告と見逃された欠陥の両方が重要な場合、単純な件数よりも多くの情報をもたらす。それでも、単一の集計スコアからは、どのアプリケーションやコーディングパターンが残るエラーを引き起こしたのかは分からない。



