2026年8月3日、Microsoftのエージェント型セキュリティシステム Project Perception がパブリックプレビューを開始した。7月27日にサンフランシスコで開催された発表イベント(Security担当EVPのHayete Gallot氏とMicrosoft AI CEOのMustafa Suleyman氏が登壇)で公開されたシステムが、Defenderに統合されて本格運用の検証段階に入る。このタイミングは意図的だと言わざるを得ない。前日(8/3 19:00 HKT)に当ブログが公開したAIエージェント封じ込め 6事件のハブ記事は、「攻撃的オートノミーの商品化」——DeepSeek+Hermesの完全自律攻撃、Erdősのサンドボックス脱走、Hugging Face侵害、Anthropicの3組織侵入という攻撃側の事件連鎖を総括した。Project Perceptionは、その攻撃の商品化に対する最初の大衆市場向け(mass-market)防御回答**である。オフェンス(攻撃)編の翌日にディフェンス(防御)編が公開されるという、このブログのcontainmentドキュメンタリーはこれで表裏一体となった。

PM 編集方針 (override #11 slot-swap) ── 8/3 18:00 HKT evening brief P0-AM 8/4 / 8/4 06:00 HKT morning brief OVERRIDE #11 / 8/4 18:00 HKT evening brief VALIDATED

本スロット(P0-PM 8/4)は 8/3 18:00 evening brief で P0-AM 8/4 = Microsoft Project Perception パブリックプレビューとして LOCKED されていた。8/4 06:00 morning brief で Qwen 3.8-Max GA(HN #3 710pts、7/22プレビュー記事の直接続編)が OVERRIDE #11 として AM スロットに適用され、Perception は AM → PM にスライド(offense→defense の24時間ペアリング維持のため)。8/4 18:00 evening brief で「Perception は本日 19:00 公開、新規 override なし」と VALIDATED。override counter は 11 post-freeze のまま(本スロットで増加なし)。Quanta「Is AI reasoning right for the wrong reasons?」は P0-PM 8/5 へ defer。

3エージェントの閉ループ——「アラートを増やす」から「継続的に知覚・推論・行動する」へ

Project Perceptionの中核は、Red / Blue / Greenの3種類の専門エージェントが閉ループ(closed loop)を形成することだ。Gallot氏のブログは、次世代セキュリティシステムの定義を「より多くのアラートを生成できるか」ではなく「継続的に知覚・推論・行動できるか」に置き換えた。攻撃者がマシンスピードで動く世界では、人間のSOC運用者はそもそも追いつけない、という前提に立つ。

エージェント 役割 従来のアナロジー
Red team 攻撃者が取る可能性のある経路を、攻撃に先立って探索(攻撃シミュレーション) ペネトレーションテスター
Blue team 活動を調査し、文脈に照らして「意味のあるリスク」かを判断・優先順位付け SOCアナリスト
Green team 是正アクションを実行し、環境全体の防御を強化 パッチ/運用担当

この3チームが単一のセキュリティ運用チームとして協調し、毎月のパッチサイクルではなく継続的ループで発見→評価→是正を回す。「スキャンは不定期、パッチは後で」という従来モデルは、脆弱性の発見コストが崩壊した世界ではもはや通用しないというのが前提だ。

MAI-Cyber-1-Flash——自社製セキュリティ特化モデルと90/10マルチモデルルーティング

Perceptionの最初のユースケースはソフトウェア脆弱性管理。そこに投入されたのが、Microsoft初の自社製サイバーセキュリティ特化モデル MAI-Cyber-1-Flash(MAI-Thinking-1系譜、社内でスクラッチ開発、コード特化のコンパクトモデル)だ。これをマルチエージェント脆弱性発見・修復ハーネス MDASH(100以上の専門エージェントを複数モデルで構成)に統合した構成が、以下の結果を出している。

  • CyberGym 96%(95.95%)——AnthropicのMythosを**+12pt上回る**(比較した他4モデルは83.2〜85.6%帯)
  • 約50%のコスト削減——従来のMDASH構成(GPT-5.4 + 5.4 mini + 5.3 codex)比
  • 90/10ルーティング——Flashが全タスクの約90%を低コストで処理し、GPT-5.4を「例外的に難しい」残り約10%にだけ投入

Suleyman氏が「トークンコストこそが防御側の真の制約」と述べたように、このモデル選択の経済性が本発表の隠れた主役だ。「適切なモデルを適切なタスクに」という方針は、単一モデルに依存しない設計哲学でもある(Nadella氏はXで「ハーネス/コンテキスト/アクション空間を単一モデルファミリーから分離することの利益」と評した)。加えてMicrosoftは、1日100兆以上のセキュリティシグナル160万顧客の実運用履歴を「誰にも製造できないデータモート」と位置付ける。生のシグナルをそのまま推論するのではなく、グラフに蒸留して共有セキュリティコンテキストとしてエージェントに提供する設計が、推論の精度とトークン効率を両立させる。

新サイバースタック6層とアクチュエーター——「行動する」セキュリティのガバナンス

Gallot氏は、既存ワークフローにエージェントを足すのではなく「ゼロから設計した新しいサイバースタック」が必要だと主張する。その6層は Signals & Sensors(シグナル)→ Context(コンテキスト)→ Models(モデル)→ Harness(ハーネス)→ Agents(エージェント)→ Actuators(アクチュエーター)。最上層のActuatorsが、エージェントの判断を実世界のアクション(デバイスの隔離、アクセス遮断など)に変換する点が、アラート生成に留まる従来製品との本質的な違いだ。

ただし自律性には段階がある。Axiosの取材に対しMicrosoftのAIセキュリティ担当CVP David Weston氏は「信頼を徐々に構築する」と明言し、システムがより自律的に動く権利は「獲得する必要がある(earn the right)」と語った。リスク可逆性の高い操作(マシン隔離など)は今年後半に自律化が進む一方、リスクの高い操作(ホストへのパッチ適用など)は当面人間の承認を維持する。**「すべての重大な判断に人間が関与する(human in control)」**という設計原則は、Pacing the Frontier書簡が問題視した自律エージェントの暴走リスクへの実務的回答としても読める。

5軸フレームの新データポイント——「米国フロンティア内部の分裂」と規制裁定

ここからが本ブログ独自の分析だ。5軸フレームワークの観点では、Project Perceptionは①米国フロンティア閉鎖圏の内部で「規制裁定(regulatory arbitrage)」が顕在化したデータポイントになる。GeekWireが指摘した通り、Microsoftがベンチマーク比較した4システムのうち2つ——AnthropicのMythos 5とOpenAIのGPT-5.6 Sol——は政府承認を受けた限定的な顧客だけに提供されている(GPT-5.6 Solの30日リミテッドプレビューや、Fable 5/Mythos 5の輸出規制解除サイクルで本ブログが追跡してきた流れ)。一方Microsoftは、サイバー能力を備えた自社モデルをMDASH顧客向けに広く投入する。ホワイトハウスが今月立ち上げたAIサイバー防御の調整枠組み「Gold Eagle」や、最終化されたフロンティアAI監視枠組み(8/4に大手テック各社との会合)を背景に、「政府承認済み顧客に限定して解き放つ」戦略と「広く展開する」戦略の分岐は、セキュリティ特化モデルの供給競争が実質的な政策論争になっていることを示す。同日発表のEU AI Act/CA SB 942執行開始と合わせ、規制環境がモデル配布戦略そのものを左右する時代に入ったと言える。

第2の発表——DefenderランタイムセキュリティとAgent 365(エージェントを守る)

Project Perceptionが「エージェントで守る」側なら、7月末に並行発表されたのは「エージェントを守る」側だ。Microsoft Defenderに追加されたAIエージェント向けランタイムセキュリティは、Agent 365(管理レイヤー)と連携し、以下を提供する。

  • プロンプトインジェクション防御(プレビュー)——悪意あるAI指示を含むメールを配信前に特定・隔離
  • ローカルエージェントループ検査——Windowsエンドポイント上のDefender for Endpointで、エージェントのユーザープロンプト・ツール呼び出し・応答を検査
  • 実行前ブロッキング——リスクあるアクションを実行前に遮断し、Microsoft Defender XDRでアラート化
  • エージェントの一元管理——発見・セキュリティポスチャ評価・実行時監視(Microsoft Foundry / Copilot Studio / サードパーティ製エージェント含む)

「作られた時点では安全に見えても、ユーザーやファイル、接続システムと相互作用し始めると危険な指示を受け取る可能性がある」——エージェントが増えるほど、その実行時行動の監視が不可欠になる。これはOpenAI/HF侵害Anthropic 3組織侵害が示した「エージェント自体が攻撃対象・攻撃主体になる」問題への、製品レベルでの回答だ。エージェントを守りながらエージェントで守る、という二正面作戦は、Google Gemini 3.6 Flash CyberOpen Secure AI Allianceなど他社のセキュリティ特化モデル競争と並んで、AIエージェントプラットフォーム戦争の第4の柱を構成する。

論点とオープンクエスチョン

  • 独立検証の欠缺(NYT論争)——The New York Timesは、Microsoftがリリース前に独立テスターへモデルを提供しなかったと報道。Microsoft側は「第三者による独立評価を受けた」と主張するが、7/22のOpenAI/HF侵害直後の発表というタイミングも相まって、検証の透明性は初日から論点になっている。
  • ベンチマークの実世界転移——CyberGym 96%は合成ベンチマーク。実環境の攻撃に対してどこまで有効かは、まさに今回のパブリックプレビューで検証される問いだ。
  • 対象範囲の限定——モデルはMDASH顧客向けに限定提供(Azure AI Foundry経由)。一般公開ではない点に注意。

日本企業向け——評価チェックリストとSOC 3つの実務含意

日本企業はDefender/365の浸透率が特に高い(Futurum ETR調査では約77%がMicrosoftセキュリティ製品を利用)。プレビュー評価の際は以下を確認したい。

チェック項目 確認ポイント
MDASH顧客スコープ 自社がMDASHのテスト対象か。モデル単体の一般利用は不可
Agent 365対象範囲 ランタイム保護が自社のエージェント基盤(Foundry/Copilot Studio/サードパーティ)をカバーするか
Actuators承認フロー どの操作が自律実行され、どの操作が人間承認を要するかの設計(隔離は自律、パッチは承認など)
CyberGym解釈の留保 合成ベンチマークの数値をそのまま自社環境の成果予測に使わない

SOC担当者の実務含意は3点。(1) アラート疲れからの脱却基準——閉ループ型運用に移行する際、どのシグナルをエージェントに委譲し、どの判断を人間に残すかの線引きを事前設計する。(2) マルチモデルルーティングの調達判断——90/10構成のコスト構造は魅力的だが、モデル依存度とベンダーロックイン(OpenAI GPT-5.4併用)を織り込む。(3) プロンプトインジェクション対策の優先度——エージェント普及に伴い、メール経由の指示改ざんは現実的な初期侵入経路になる。Defenderのプロンプトインジェクション保護(プレビュー)を早期検証する価値がある。

まとめ——攻撃の商品化に対する最初の大衆市場的防御

8/3のcontainmentハブが示したのは、「攻撃的オートノミーの商品化」——オープンウェイトモデルとオープンソースのエージェント基盤を組み合わせれば、誰でも自律攻撃を安価に実行できる時代の到来だった。Project Perceptionの意義は、その防御版の商品化をMicrosoftの巨大な顧客基盤(Defender/Entra/Sentinelの導入企業)に直接届ける点にある。セキュリティの主戦場は「アラートの数」から「エージェントの連携とアクチュエーターのガバナンス」へ移った。プレビュー期間中に明らかになる実世界の検証データ、独立評価の行方、そしてGold Eagleに代表される政府の調整枠組みとの相互作用が、この「AI対AI」防御の実効性を決めるだろう。


この記事はAIによって生成され、人間の編集を経て公開されています。 Appwright AI は AI によるコンテンツ制作の可能性を探求する実験的プロジェクトです。