Mistral Shieldstral完全解説——3Bオープンウェイトが「ポリシーを質問に変える」多モーダル安全分類器とEU AI Act執行週の意味

2026年8月4日、フランスのAIラボMistralが3Bパラメータのオープンウェイト多モーダル安全分類器「Shieldstral」を公開した(Apache 2.0、Hugging Faceで配布)。単一の16GB NVIDIA GPUで動作し、テキスト安全性では7倍の規模のモデルに匹敵、多モーダルモデレーションでは新SOTAを主張する。 このリリースが単なる「小さな安全モデル」の域を超えているのはタイミングにある。EU AI Act第50条(透明性義務)とカリフォルニアSB 942の執行が開始された8月2日からわずか3日後、8月2日の同時執行と3地域トリフレクタの完成直後に、欧州ラボが「規制対応ツール」をオープンウェイトで出してきたのだ。 本記事ではShieldstralの仕組み・ベンチマーク・訓練方法を一次情報(Mistral公式ブログ・Hugging Faceモデルカード・arXiv:2607.25857)から解説し、vLLM実装コード、ポリシー質問の書き方、閾値チューニング、日本企業のコンプライアンス適用例を実務ガイドとしてまとめる。 中核のイノベーション:「モデレーションを質問応答にする」 従来のガードレールモデルは、訓練時に暴力・憎悪・性表現などの危険カテゴリの固定タクソノミーを重みに焼き付ける。そのため新しいデプロイ文脈(例:「サイバーセキュリティ研究ツールには安全だが、メンタルヘルスプラットフォームには有害」)に再ターゲットするには再訓練が必要だった。Shieldstralはこれを二値の質問応答(binary question-answering)タスクとして再構成する。各リクエストは3つのフィールドで構成される: <Instruct> 評価文脈・厳格度・(任意で)「安全でない」の定義 <Query> 単一のyes/no質問(例:「このコンテンツは身体的暴力を助長していますか?」) <Document> 判定対象のコンテンツ(プロンプト/レスポンス/ペア/画像+テキスト) 推論メカニズム: モデルはyesとnoのロジットだけを読み出し、softmax正規化して連続的なキャリブレーション済み安全スコアを単一フォワードパスで返す。アプリケーション側はこのスコアに閾値を設定してブロック判断したり、信頼度でランキングしたりできる。この単一の定式化がプロンプト分類・レスポンスモデレーション・拒否検出・毒性検出を1つの問題に統一し、1つのチェックポイントが再訓練なしに新しいポリシーへ適応できる。 ベンチマーク:7倍のモデルに匹敵する実力 Mistralは10のオープンベースライン・16ベンチマークで評価したと報告する(評価サンプルはすべて訓練からホールドアウト)。 テキスト安全性(F1 %) ベンチマーク Shieldstral-3B GPT-OSS-Safeguard-20B Qwen3Guard-8B LlamaGuard-4-12B ShieldGemma-9B WildGuardTest (prompt) 88.1 87.3 88.2 74.3 46.0 ToxicChat (prompt) 84.1 79.8 75.6 51.0 62.4 HarmBench (prompt) 99.4 94.5 99.3 96.1 50.2 Aegis v2 (response) 87.2 75.2 86.2 64.7 59.7 XSTest Harm (response) 93.5 93.8 92.9 89.0 80.6 多モーダル安全性(F1 %) ベンチマーク Shieldstral-3B OmniGuard-7B LlavaGuard-7B ShieldGemma-2-4B VLGuard 97.7 88.5 69.5 61.3 UnsafeBench 81.8 72.6 63.9 54.9 LlavaGuard 72.0 71.7 81.4 56.2 読み方: 3Bモデルが12〜20Bの競合に大半のカテゴリで勝利または互角。特に多モーダル(VLGuard 97.7 / UnsafeBench 81.8)は圧勝で、画像+テキストの統合判定が明確な強み。一方、RTP-LX多言語プロンプト(70.3)ではNemotron-3.5-Content-Safety-4B(86.1)に明確に敗北しており、多言語プロンプト分類は弱点として残る。平均スコアはテキスト安全性84.9%、多モーダル安全性83.8%。数値はすべてMistral自己申告で、独立系の追試はまだない点に注意が必要だ。 ...

August 6, 2026 · 25 min · 4951 words · Appwright