Comment évaluer les affirmations d'un agent SOC IA : demandez le journal des défaillances
Chaque IA SOC Les démos des fournisseurs que j'ai vues, y compris la nôtre, sont excellentes. Elles fonctionnent avec des alertes sélectionnées, des intégrations fonctionnelles et sans simulation. Ce qui distingue les plateformes performantes des simples présentations, ce n'est pas “ peut-elle résoudre une alerte ? ” mais “ montrez-moi ses erreurs du dernier trimestre et comment vous les avez identifiées. ”
En bref: Évaluer un agent SOC IA implique de le valider à l'aide de données probantes que vous contrôlez. Cela inclut vos alertes, votre environnement et vos analystes ; et non les données fournies par le prestataire.
Les agents IA des SOC promettent d'automatiser la phase d'investigation : triage, enrichissement des données et verdict. L'évaluation structurée permet de vérifier si cette automatisation est réellement efficace dans votre environnement. Les recommandations de Gartner sur ce marché commencent par une projection essentielle : d'ici 2028, 70 % des grands SOC testeront des agents IA pour les tâches de niveau 1 et 2, et seulement 15 % d'entre eux constateront une amélioration mesurable de leurs opérations de sécurité de l'information sans évaluation structurée. L'évaluation structurée n'est pas un simple tableau de bord des réponses des fournisseurs. Il s'agit d'un ensemble d'exigences en matière de preuves. Voici celles que j'utiliserais.
1. Demandez le journal des défaillances
Un système d'IA de production effectuant un travail d'investigation commet des erreurs. Ce n'est pas rédhibitoire ; les analystes humains en font aussi. Ce qui est rédhibitoire, c'est qu'un fournisseur soit incapable de les identifier.
Demander: Quel est votre taux de faux négatifs mesuré sur les alertes clôturées ? Comment le mesurez-vous ? Quels ont été vos trois derniers incidents majeurs non détectés ? Un fournisseur expérimenté effectue un contrôle qualité continu, incluant un échantillonnage des alertes clôturées par les agents pour une vérification humaine, le suivi des taux de révision des verdicts et des tests de régression du comportement des agents lors de modifications des modèles. Il peut fournir des données chiffrées. Un fournisseur qui se contente de vanter sa précision (“ précision 99% ”) sans pouvoir décrire sa méthodologie de mesure indique clairement qu'il n'en a pas. Lors de toutes les évaluations que j'ai menées, les fournisseurs incapables de produire un journal des erreurs ne mesurent pas leurs performances ou préfèrent les dissimuler.
La logique sous-jacente : Un faux positif vous coûte de précieuses minutes ; un faux négatif, même justifié par une raisonnement péremptoire, vous expose à une faille de sécurité dont vous ignoriez l’existence. Toute évaluation qui néglige les faux négatifs ne prend en compte que la partie la moins problématique du problème.
2. Exiger des enquêtes rejouables
Pour chaque verdict, vous devriez pouvoir consulter : chaque requête effectuée par l’agent, chaque résultat obtenu, le raisonnement à chaque étape, le niveau de confiance final et l’action entreprise. Non pas un résumé, mais l’historique complet, conservé de manière immuable.
Cela est important pour trois raisons distinctes :
- Sur le plan opérationnel, c'est ainsi que vos analystes évaluent la confiance et détectent les dérives.
- Sur le plan contractuel, c'est ainsi que vous tenez le fournisseur responsable de ses réclamations.
- Et sur le plan institutionnel, c'est ainsi que vous défendez une décision automatisée a posteriori, auprès d'un auditeur, d'un organisme de réglementation, d'un assureur cyber ou de votre propre conseil d'administration.
Si vous travaillez sous FedRAMP, Dans le cadre des normes PCI, DORA ou équivalentes du secteur, un verdict inexplicable est un constat qui ne demande qu'à être établi. Gartner place la gouvernance et l'explicabilité parmi ses sept catégories d'évaluation précisément pour cette raison : un organisme incapable de fournir un raisonnement vérifiable est une boîte noire.
Testez-le en vue subjective : Sélectionnez au hasard cinq alertes clôturées et reconstituez chaque enquête à partir du seul enregistrement. Si vous devez contacter le fournisseur pour obtenir des explications, cela ne sera pas auditable.
3. Rendre les limites de l'autonomie explicites et techniques
Obtenez la réponse précise aux questions suivantes : quelles actions ce système peut-il entreprendre sans intervention humaine, où cela est-il appliqué, et puis-je le configurer par type d’action et niveau de risque ?
Le point d'application est souvent négligé dans les évaluations. “ L'agent a pour instruction de ne pas désactiver les comptes ” est une consigne, pas un contrôle. Un contrôle est une logique de flux de travail externe au modèle qui rend l'action impossible sans une étape d'approbation, agissant comme des garde-fous déterministes autour d'un raisonnement probabiliste. Le cadre de Gartner insiste sur cette même distinction : comment les garde-fous sont-ils appliqués pour les actions à fort impact telles que la désactivation de comptes ou l'isolation du réseau ? Et en cas d'ambiguïté, le système privilégie-t-il l'escalade plutôt que l'action ?
La conception des garde-fous est cruciale lorsque le système est confronté à une menace active ; c’est précisément à ce moment-là que les agents sont soumis à une forte pression et susceptibles d’agir de manière inappropriée. Si un fournisseur est incapable de vous démontrer le mécanisme (et non la politique), considérez qu’il n’existe pas.
4. Tester la profondeur d'intégration, et non le nombre d'intégrations.
Sélectionnez les cinq outils les plus importants dans votre arsenal et testez trois niveaux pour chacun :
- L'agent peut-il le lire ?
- Peut-il l'interroger en cours d'enquête (extraire un arbre de processus, rechercher des journaux d'identité, analyser une boîte aux lettres) ?
- Peut-il agir à travers cela, sous réserve de vos garde-fous ?
Une page d'intégration affichant 300 logos se réduit systématiquement à un mode lecture seule sur les outils qui vous intéressent. C'est pourquoi il ne faut pas se fier aveuglément à cette profusion de logos. Posez-vous également la question de l'architecture : la plateforme exige-t-elle la centralisation de vos données, ou peut-elle interroger leur emplacement ? Les implications en termes de coûts et de migration varient considérablement.
5. Mesurez les résultats par rapport à votre situation de référence, dans votre environnement.
Définissez le succès avant même le début de la phase de suivi, dans vos alertes et par rapport à vos chiffres actuels. Les indicateurs clés sur lesquels il est pertinent de se baser :
- Temps moyen de confinement (MTTC) : L'indicateur de référence recommandé par Gartner, car c'est au niveau du confinement que le risque est réduit.
- Réduction des faux positifs : Contacter les analystes, avec une précision d'escalade (de ce qui est aggravé, et de ce qui le méritait).
- Taux de faux négatifs échantillonné : Vos analystes principaux réexaminent un échantillon aléatoire d'alertes clôturées par un agent. C'est une étape que la plupart des équipes négligent, et pourtant la seule qui permet de valider les clôtures que vous n'auriez jamais l'occasion de consulter autrement.
- Coût par alerte résolue à chargeModélisez une journée de forte activité d'alertes. Une tarification par alerte et par jeton peut transformer une attaque en un événement de facturation.
Testez-le sur un flux de travail unique et à fort volume, comme le triage des alertes de phishing ou des terminaux, pendant 30 à 60 jours. Les indicateurs de volume tels que “ 40 000 alertes analysées ” reflètent l’activité et non les résultats ; considérez-les comme un outil marketing.
6. Évaluez le fournisseur, pas seulement le produit.
Ce marché est jeune, concurrentiel et en pleine consolidation. Les listes de fournisseurs recenseront quinze fournisseurs, voire plus, en 2026, dont beaucoup ont moins de cinq ans. Certains seront rachetés ; d’autres disparaîtront. Gartner recommande d’évaluer la viabilité des fournisseurs comme un risque lié aux tiers et de privilégier les abonnements de courte durée, le temps que le marché évolue. Renseignez-vous sur leur conformité aux normes SOC 2 et FedRAMP, leurs politiques de gestion et d’entraînement des données, ainsi que sur l’impact d’un arrêt de production sur vos flux de travail et votre historique d’audit.
Résumé gênant
La plupart des évaluations de SOC basées sur l'IA échouent car elles sont structurées autour de démonstrations et d'appels de référence, deux canaux que les fournisseurs maîtrisent le mieux. Restructurez la vôtre en vous appuyant sur des éléments de preuve que le fournisseur ne contrôle pas : vos alertes, votre configuration de référence, l'analyse par vos analystes seniors d'un échantillon de cas résolus et un journal des incidents dont le fournisseur dispose ou non.
Les fournisseurs qui ont développé des solutions pour la production accueilleront favorablement cette nouveauté. Ceux qui ne l'ont pas fait la jugeront inutile. Cette réaction constitue en elle-même l'évaluation la plus rapide que vous puissiez réaliser.
Découvrez Swimlane AI SoC en action
Découvrez comment associer l'automatisation déterministe à l'IA agentielle pour gérer les alertes inédites ou ambiguës. Adaptez votre contexte organisationnel unique à Swimlane AI SOC pour une IA fiable à grande échelle.

