AI SOCエージェントの主張を評価する方法:障害ログを要求する
毎 AI SOC 弊社を含め、これまで見てきたベンダーのデモはどれも素晴らしいものでした。デモは厳選されたアラートと正常に動作する統合機能を使用し、攻撃者は登場しません。真のプラットフォームと見せかけだけのプラットフォームを分けるのは、「アラートを解決できるか?」ではなく、「前四半期に何が間違っていたのか、そしてどのようにしてそれを発見したのかを見せてほしい」という点です。“
要するに: AI SOCエージェントを評価するということは、自社が管理する証拠に基づいてその有効性を検証することを意味します。これには、ベンダーが収集した証拠ではなく、自社のアラート、環境、アナリストのデータが含まれます。.
AI SOC エージェントは調査レイヤー、つまりトリアージ、エンリッチメント、および判定の作業を自動化することを約束しており、構造化された評価は、その自動化が実際に自社の環境で機能するかどうかを検証する方法です。この市場に関する Gartner のガイダンスは、すべての評価を規律するべき予測から始まります。2028 年までに 70% の大規模 SOC が Tier 1/Tier 2 作業に AI エージェントを試験的に導入しますが、構造化された評価なしで情報セキュリティ運用で測定可能な改善が見られるのは 15% だけです。構造化された評価は、ベンダーの回答のスコアカードではありません。それは証拠要求のセットです。私が使用するセットは次のとおりです。.
1. 障害ログを要求する
調査業務を行う実稼働中のAIシステムは間違いを犯す。それは不適格な理由ではない。人間のアナリストも間違いを犯すからだ。不適格なのは、その間違いを説明できないベンダーである。.
聞く: クローズされたアラートの偽陰性率はどのくらいですか?どのように測定していますか?また、直近の重大な見逃しはどのようなものでしたか?成熟したベンダーは、エージェントがクローズしたアラートをサンプリングして人間がレビューしたり、判定覆し率を追跡したり、モデルが変更されたときにエージェントの動作を回帰テストしたりするなど、継続的な品質保証を実施しています。彼らは数値で答えることができます。精度マーケティング(「99%の精度」)で答えるベンダーは、測定方法を説明できないため、測定方法がないと言っているようなものです。私が実施したすべての評価において、障害ログを作成できないベンダーは、測定していないか、測定結果を知られたくないかのどちらかです。.
より深い論理: 誤検出は数分の時間を無駄にしますが、自信満々に提示された誤検出は、気づかなかった情報漏洩を見逃すことになります。誤検出の側面を検証しない評価は、問題の片側だけを捉えているに過ぎません。.
2. 再現可能な調査を要求する
どのような判断を下す場合でも、エージェントが実行したすべてのクエリ、受信したすべての結果、各ステップでの推論、最終的な確信度、および実行されたアクションを確認できる必要があります。要約文ではなく、実際の履歴が不変的に保存される必要があります。.
これは以下の3つの理由から重要です。
- 運用面では、アナリストが信頼度を測り、乖離を察知する方法となります。.
- 契約上、それはベンダーに請求を履行させるための方法です。.
- そして組織的な観点から言えば、自動化された意思決定を事後的に、監査人、規制当局、サイバー保険会社、あるいは自社の取締役会に対してどのように弁明するか、ということが問題となる。.
運営する場合 FedRAMP、, PCI、DORA、あるいは業界における同等の基準において、説明のつかない判定は、いずれ必ず発生する問題です。ガートナーがガバナンスと説明可能性を7つの評価カテゴリーの1つに挙げているのは、まさにこの理由からです。監査可能な論理的根拠を明確に説明できない主体は、ブラックボックスとみなされるのです。.
POVでテストしてみましょう: クローズされたアラートの中からランダムに5件を選び、記録のみに基づいてそれぞれの調査を再構築してください。ベンダーに電話で説明を求める必要がある場合、その調査は監査対象外となります。.
3. 自律性の境界を明確かつ技術的に定める
このシステムは、人間の介入なしにどのようなアクションを実行できるのか、それはどこで強制されるのか、そしてアクションの種類やリスクレベルごとに設定できるのか、といった疑問に対する正確な答えを得られます。
実施上のポイントは、ほとんどの評価で見落とされている部分です。「エージェントはアカウントを無効化しないように指示されている」というのは指示であって、制御ではありません。制御とは、モデル外のワークフローロジックであり、確率的推論に対する決定論的なガードレールのように機能する承認ステップなしではアクションを実行できないようにします。ガートナーのフレームワークも同じ区別を強調しています。アカウントの無効化やネットワークの隔離といった影響の大きいアクションに対してガードレールはどのように実施されるのか、また、曖昧な状況下でシステムはアクションではなくエスカレーションをデフォルトとするのか、ということです。
ガードレールの設計が最も重要になるのは、システムがアクティブな脅威を処理している時です。まさにその時こそ、エージェントは最も強いプレッシャーにさらされ、誤った行動をとる可能性が最も高くなります。ベンダーがポリシーではなく、そのメカニズムを示すことができない場合は、そのメカニズムは存在しないと考えるべきです。.
4. 統合の回数ではなく、統合の深さをテストする
使用するツールの中で最も重要な5つのツールを選び、それぞれについて3つのレベルをテストしてください。
- エージェントはそこから読み取ることができますか?
- 調査の途中でクエリを実行することはできますか(プロセスツリーの取得、IDログの検索、メールボックスのスキャンなど)?
- それは、あなたの設定した制約条件の下で、それを通して作用できるのでしょうか?
300個ものロゴが掲載された統合ページは、必要なツール上では読み取り専用になってしまうことがよくあります。だからこそ、ロゴの羅列を鵜呑みにしてはいけません。また、アーキテクチャ上の問題も考慮する必要があります。プラットフォームはデータの集中管理を必要とするのか、それともデータの保存場所を照会できるのか。コストと移行への影響は大きく異なります。.
5.あなたの環境におけるベースラインと比較して結果を測定する
POV開始前に、アラート設定時、現在の数値に基づいて成功の定義を明確にしましょう。重視すべき指標は以下のとおりです。
- 封じ込めまでの平均時間(MTTC): ガートナーが推奨するアンカー指標は、リスクが低減されるのは封じ込めの段階だからである。.
- 偽陽性率の低減: アナリストに、エスカレーションの精度(エスカレーションの内容、エスカレーションに値する程度)を知らせる。.
- サンプリングされた偽陰性率: 上級アナリストが、エージェントによってクローズされたアラートの中からランダムに抽出したサンプルを再確認します。これは多くのチームが省略する手順ですが、通常では確認することのないクローズ済みアラートの妥当性を検証する唯一の方法です。.
- 負荷時の解決済みアラートあたりのコストアラートが大量に発生する日をモデル化してみましょう。アラートごと、トークンごとの料金設定により、攻撃が課金イベントに変わる可能性があります。.
フィッシング対策やエンドポイントトリアージなど、処理量の多い単一のワークフローで30~60日間実行してください。「4万件のアラートを調査」といったボリューム指標は活動量を示すものであり、成果を示すものではありません。これらはマーケティング指標として捉えてください。.
6.製品だけでなく、ベンダーも評価する
この市場はまだ若く、競争が激しく、統合が進んでいます。2026年のリスト記事では、15社以上のベンダーが取り上げられ、その多くは設立から5年未満です。買収されるベンダーもあれば、消滅するベンダーもあるでしょう。ガートナーは、市場が変動する中で、ベンダーの存続可能性をサードパーティリスクの問題として捉え、契約期間を短くすることを推奨しています。SOC 2およびFedRAMPの認証状況、データ処理およびモデルトレーニングに関するポリシー、そして製品が廃止された場合にワークフローと監査履歴がどうなるかについて確認しておきましょう。.
不快な要約
AI SOCの評価が失敗に終わるのは、デモとリファレンスコールという、ベンダーが最もコントロールしやすい2つのチャネルで構成されているためです。ベンダーがコントロールできない証拠、つまりアラート、ベースライン、シニアアナリストによる解決済みケースのサンプリング、そしてベンダーが保有しているか否かにかかわらず存在する障害ログを中心に評価を再構築しましょう。.
本番環境向けに製品を開発したベンダーはこれを歓迎するだろう。そうでないベンダーは不要だと考えるだろう。その反応こそが、最も迅速な評価方法だ。.
Swimlane AI SOCの実際の動作をご覧ください
決定論的な自動化とエージェント型AIを組み合わせることで、新規または曖昧なアラートを処理する方法をご覧ください。独自の組織コンテキストをSwimlane AI SOCに適用することで、大規模な環境でも信頼性の高いAIを実現できます。.

