PandIA

Microsoft revendique 96 % sur CyberGym, mais son IA n’a pas encore fait ses preuves

Microsoft revendique 96 % sur CyberGym, mais son IA n’a pas encore fait ses preuves

Une IA capable de repérer des failles ne vaut que par sa capacité à travailler dans les conditions d’une équipe de sécurité réelle. Avec Perception, Microsoft veut franchir ce cap : son système d’agents aurait atteint 96 % sur CyberGym, soit 12 points de plus que le modèle Mythos, tout en réduisant presque de moitié le coût de sa configuration actuelle.

Microsoft ouvre Perception aux équipes de sécurité

Le projet Perception entrera en préversion publique le 3 août 2026, annonce Microsoft. Son objectif est de transformer l’IA de cybersécurité en outil opérationnel de recherche de vulnérabilités, plutôt qu’en simple assistant capable d’expliquer du code ou de résumer des alertes.

Le dispositif repose sur MAI-Cyber-1-Flash, un modèle développé en interne par Microsoft, intégré à une équipe d’agents spécialisés. Cette architecture dite multi-agent permet à plusieurs instances logicielles de collaborer autour d’une même tâche de sécurité : analyser un logiciel, identifier des comportements suspects et contribuer à la validation d’une vulnérabilité.

Microsoft ne présente donc pas uniquement un nouveau modèle de langage. L’enjeu porte sur la combinaison entre le modèle, les agents et les outils mobilisés pour explorer un environnement logiciel. Dans ce type de système, la performance dépend autant de la qualité du modèle que de sa capacité à enchaîner des actions, à conserver le contexte et à revenir sur ses hypothèses.

L’ouverture en préversion publique doit permettre à des utilisateurs externes de tester cette approche dans des scénarios de recherche de failles. Le terme préversion reste important : il signale un produit accessible, mais encore susceptible d’évoluer avant une disponibilité générale.

Un score de 96 % qui place Mythos derrière

Le principal argument de Microsoft tient dans un chiffre : 96 % sur CyberGym, un benchmark conçu pour évaluer les capacités d’une IA dans des tâches liées à la sécurité logicielle.

Selon l’entreprise, Perception dépasse de 12 points le modèle Mythos. Si l’écart est exprimé en points de pourcentage, la configuration de référence obtient donc environ 84 %. La comparaison donne à Microsoft un avantage net sur le protocole de test retenu, mais elle ne suffit pas à mesurer à elle seule l’efficacité d’un système en production.

Un benchmark peut vérifier qu’un agent détecte une faiblesse dans un code connu ou qu’il suit correctement un scénario défini. Il ne mesure pas nécessairement sa robustesse face à des applications propriétaires mal documentées, à des architectures distribuées ou à des dépendances rarement utilisées. Il ne renseigne pas non plus directement sur le taux de faux positifs, le temps nécessaire à l’analyse ou la qualité des recommandations adressées aux développeurs.

La performance annoncée doit donc être lue comme un indicateur de capacité, pas comme la preuve qu’une équipe de sécurité peut déléguer entièrement sa recherche de vulnérabilités à Perception. Dans ce domaine, une faille détectée trop tard, mal qualifiée ou impossible à reproduire conserve une valeur opérationnelle limitée.

La bataille se joue aussi sur le coût

Microsoft avance un deuxième argument, plus directement lié à l’adoption : Perception permettrait de réaliser près de 50 % d’économies par rapport à la configuration actuelle de MDASH, le système de référence utilisé par l’entreprise pour ses travaux de sécurité.

Cette promesse est stratégique. Les systèmes d’IA appliqués à la cybersécurité peuvent multiplier les appels à des modèles coûteux, notamment lorsqu’ils doivent inspecter de grandes bases de code, lancer plusieurs pistes d’analyse ou demander des vérifications successives. Une architecture d’agents performante mais trop chère risque de rester cantonnée à des démonstrations ou à quelques missions prioritaires.

L’utilisation de MAI-Cyber-1-Flash semble répondre à cette contrainte. Microsoft cherche à proposer un modèle suffisamment compétent pour des tâches techniques, mais moins coûteux à exécuter qu’une configuration reposant sur des modèles plus lourds. L’économie revendiquée ne signifie toutefois pas que chaque analyse coûtera automatiquement moitié moins cher pour tous les clients : elle dépendra du volume de code, du nombre d’agents mobilisés et des ressources informatiques nécessaires.

Le rapport coût-performance devient néanmoins un critère central. Une IA qui trouve davantage de failles, mais consomme beaucoup plus de calcul, peut être moins utile qu’un système légèrement moins précis mais déployable en continu.

De l’assistant au chasseur de failles

Avec Perception, Microsoft tente de déplacer le rôle de l’IA dans le cycle de sécurité. Les premiers outils génératifs ont surtout servi à produire des explications, suggérer des correctifs ou accélérer l’écriture de scripts. L’approche défendue ici vise une participation plus active à la recherche elle-même.

La différence est importante. Un assistant répond à une demande formulée par un analyste. Une équipe d’agents peut, elle, décomposer une mission, explorer plusieurs hypothèses et poursuivre une piste jusqu’à obtenir un résultat exploitable. Cette autonomie reste encadrée par les outils, les droits d’accès et les règles de validation, mais elle rapproche l’IA du travail quotidien d’un chercheur en vulnérabilités.

Pour les équipes de sécurité, l’intérêt potentiel est concret : réduire le temps consacré aux analyses répétitives, tester davantage de composants et concentrer les experts sur les cas ambigus. Pour les éditeurs de logiciels, la pression pourrait aussi augmenter si les systèmes automatisés identifient plus rapidement des défauts dans des produits largement déployés.

Cette évolution introduit cependant un risque symétrique. Les mêmes capacités peuvent servir à identifier des failles avant leur correction. La gouvernance des accès, la traçabilité des actions des agents et la validation humaine des résultats resteront indispensables, en particulier lorsque l’IA manipule du code sensible ou intervient dans des environnements de production.

Une préversion à confronter au terrain

Les résultats de CyberGym donnent à Microsoft un point de départ favorable face à Mythos. La prochaine étape sera de vérifier si l’écart de 12 points se maintient sur des bases de code variées et dans des conditions moins standardisées.

Le jalon concret sera l’ouverture de la préversion publique, le 3 août 2026. Les premiers retours devront porter sur trois indicateurs : le taux de vulnérabilités réellement confirmées, le temps économisé par les analystes et le coût par analyse. C’est sur ces mesures, plus que sur le seul score de benchmark, que Perception pourra démontrer sa valeur comme outil de recherche de failles utilisable au quotidien.

Recevez les dernières actualités sur l'IA dans votre boite mail

envelope
Si vous souhaitez recevoir un résumé de l'actualité ainsi que nos derniers guides sur l'IA rejoignez nous !
Actualités Guides Liste IA Prompts Newsletter