発生日:2026年8月4日。 Mistral AIは、テキスト、画像、およびテキストと画像を組み合わせたコンテンツの安全性を評価するための、30億パラメーターのオープンウェイトモデル「Shieldstral」を発表した。同社はこの分類モデルをApache 2.0ライセンスで公開し、16GBのメモリーを搭載したNvidia製GPU 1基で実行できるとしている。

Shieldstralの中心的な設計上の選択は、モデル内に固定された有害性カテゴリーの一覧を組み込むのではなく、モデレーションを二者択一の質疑応答問題として扱うことだ。リクエストには、評価の文脈と厳格さを説明する指示、「はい」か「いいえ」で答えるポリシー上の質問、そして評価対象の素材が含まれる。文書には、プロンプト、回答、プロンプトと回答の組み合わせ、または任意のテキストを添えた画像を使用できる。

推論時にモデルは「はい」と「いいえ」のロジットを評価し、連続スコアへ正規化する。開発者はその後、しきい値を選択するか、結果を順位付けに利用できる。ポリシーが自然言語のクエリとして記述されるため、Mistralによると、運用者はモデルを再訓練せずに検査対象を変更できる。同一のチェックポイントを、プロンプトの分類、回答のモデレーション、拒否検出、毒性評価などのタスクに使用できる。

Mistralの報告によると、Shieldstralは、テキストの安全性、拒否検出、ポリシーへの適応性、マルチモーダル・モデレーションの評価全体で、最大7倍の規模を持つオープンなガードモデルと同等以上の性能を示した。これらの結果は開発元自身によるベンチマーク上の主張であり、発表では評価用サンプルを訓練から除外したとしている。また、同モデルがマルチモーダル・モデレーションで新たな最高水準を確立したとも述べている。

訓練プロセスでは、分類体系やアノテーション方式が異なるデータセットを統合した。Mistralはそれらを共通の「指示・クエリ・文書」構造に変換し、単一の言い回しのパターンへの依存を減らすため、表現や区切り文字を変化させた。同社はさらに、類似するポリシー間の違いを学習させることを目的とした対照例を生成した。視覚的モデレーションでは、限られた安全性データセットを汎用画像の否定例で補完し、視覚言語リランカーを使用して画像とクエリの組み合わせを選別した。

Mistralによると、LoRAで個別のチェックポイントをファインチューニングし、その後、球面線形補間を用いて統合した。一つの構成要素は公開データにおける較正を、別の構成要素はポリシーの識別を対象とし、基盤となる指示モデルは一般的な指示追従動作に寄与した。訓練と評価は、インフラ、シャーディング、指標、ログを管理するMistralのプラットフォーム「Forge」上で行われた。

今回の公開により、開発者には、固定的なカテゴリーを中心に構築されたガードレールに代わる、比較的小型で設定可能な選択肢が提供される。Mistralは、多言語対応、長文書での信頼性、より幅広いマルチモーダル対応には課題が残るとしている。同社が報告した性能がさまざまな製品やモデレーションポリシーにどの程度適用できるかは、実環境での採用と独立した試験によって明らかになる。オープンライセンスにより、開発者がウェイトを直接ダウンロードして評価できるため、こうした検証も容易になる可能性がある。