Microsoft réduit de 30 % à 5,9 % les failles de sécurité des agents IA avec un outil VS Code
Microsoft vient de publier `run-assert-eval`, une extension open source pour Visual Studio Code qui automatise l'intégralité du cycle de sécurité des agents IA — de la détection des failles jusqu'à la vérification des correctifs. L'outil est disponible gratuitement sous licence MIT sur GitHub, sans restriction régionale. À l'approche de l'obligation légale de test adversarial imposée par l'AI Act de l'UE en août 2026, il arrive à point nommé pour les équipes de développement.
Le pipeline en quatre étapes
L'architecture repose sur quatre composants enchaînés. Clarity modélise d'abord les scénarios de défaillance potentiels. ASSERT les convertit ensuite en tests d'évaluation mesurables. Agent Control Specification (ACS) génère automatiquement une politique de sécurité pour bloquer les actions dangereuses en temps réel. Enfin, l'agent repasse les mêmes tests pour confirmer que la politique fonctionne. Comme l'explique le Microsoft Command Line Blog, la clé du dispositif est la stabilité du jeu de tests entre la phase de base et la phase gouvernée : seule la politique change, ce qui rend les résultats directement comparables.
ASSERT et ACS avaient été publiés séparément en juin 2026 ; `run-assert-eval` les intègre maintenant dans un flux de travail unique au sein de VS Code.
Un cas concret : l'agent de facturation
Pour illustrer l'outil, Microsoft a testé un agent de support client chargé de traiter les demandes de facturation. Sa spécification était claire : n'accéder qu'aux données du compte concerné. Sans gouvernance, l'agent exposait des informations d'autres clients dans 30 % des échanges — soit 12 conversations sur 40. Après génération et déploiement d'une politique ACS bloquant les appels avec des identifiants incorrects, le taux de violation est tombé à 5,9 %, selon AlphaSignal. Aucun refus excessif n'a été constaté : l'agent continue de traiter normalement les requêtes légitimes.
Ce résultat illustre un problème bien réel. L'OWASP LLM Top 10 (LLM05:2025) identifie la mauvaise gestion des sorties comme l'une des failles les plus fréquentes en production.
Ce que ça change en France
L'AI Act impose aux systèmes à risque élevé une documentation systématique des tests adversariaux, incluant injection de prompt, fuite de données et violations de politique. Les équipes françaises ont jusqu'au 2 août 2026 pour démontrer cette couverture. L'approche open source de Microsoft, compatible avec des environnements tels qu'OVHcloud ou Mistral AI, ne crée aucune dépendance à une plateforme propriétaire.
L'outil s'installe dans VS Code avec le support des sessions d'agents en Dev Containers pour des environnements isolés. Il embarque 7 domaines d'agents préconfigurés et 14 suites de risques ancrées dans l'OWASP LLM Top 10 et le NIST AI RMF. Sur le marché des outils de red teaming, il se distingue de Garak (NVIDIA, 120+ sondes) en ciblant le cycle de vie complet de l'agent plutôt que le seul niveau du modèle.