PandIA

Microsoft revendique 96 % sur CyberGym, Mythos accuse déjà 12 points de retard

Microsoft revendique 96 % sur CyberGym, Mythos accuse déjà 12 points de retard

96 % sur CyberGym : Microsoft affirme avoir placé son système d’IA de cybersécurité 12 points devant Mythos, un écart suffisamment net pour transformer un benchmark technique en duel public. Derrière ce résultat, l’entreprise prépare une plateforme destinée à automatiser une partie de la détection et de la réponse aux attaques, avec une préversion annoncée pour le 3 août 2026.

Microsoft mise sur une équipe d’agents plutôt que sur un modèle isolé

Le résultat revendiqué repose sur MDASH, un système multi-agents associé à MAI-Cyber-1-Flash, le modèle spécialisé de Microsoft pour les tâches de cybersécurité. L’architecture ne consiste donc pas seulement à soumettre des requêtes à un grand modèle généraliste : plusieurs agents coordonnés peuvent analyser une vulnérabilité, générer des hypothèses, tester des pistes et proposer une réponse.

Sur CyberGym, Microsoft annonce un score de 96 %, contre environ 84 % pour Mythos selon la comparaison publiée par l’entreprise. L’écart de 12 points est présenté comme un indicateur de la capacité de MDASH à mener des opérations complexes dans un environnement contrôlé.

Le choix d’un système multi-agents répond à une difficulté centrale de la sécurité informatique : une investigation ne suit pas toujours une séquence linéaire. Elle exige de croiser des journaux, du code, des alertes, des configurations et des renseignements sur les menaces. Un agent peut examiner une anomalie, un autre rechercher une faille exploitable, tandis qu’un troisième vérifie la cohérence de la réponse proposée.

Cette organisation peut aussi limiter la dépendance à un seul raisonnement produit par le modèle. Elle introduit toutefois une autre source de complexité : la coordination entre agents, la validation de leurs conclusions et la prévention des erreurs en cascade.

Un score spectaculaire, mais à lire dans son cadre

CyberGym fournit un terrain de comparaison utile pour mesurer la capacité d’un système à résoudre des problèmes de sécurité. Un score de 96 % signale une performance élevée dans les scénarios couverts par le benchmark. Il ne constitue pas, à lui seul, une garantie de détection équivalente dans les réseaux d’entreprises ou face à des attaquants réels.

La comparaison avec Mythos doit également être interprétée avec prudence. Les résultats sont annoncés par Microsoft, qui développe le système évalué. Pour établir une hiérarchie durable, il faudrait connaître précisément les versions testées, les paramètres d’exécution, les ressources disponibles, le coût de chaque tentative et les conditions de reproductibilité.

Le benchmark ne mesure pas nécessairement les dimensions les plus difficiles d’un déploiement opérationnel : faux positifs, respect des politiques internes, qualité des explications, résistance aux données manipulées ou capacité à éviter une action dangereuse. En cybersécurité, une réponse techniquement brillante mais déclenchée au mauvais moment peut provoquer une interruption de service ou masquer une attaque en cours.

Le chiffre de 96 % doit donc être compris comme un signal de maturité sur un protocole donné, pas comme une preuve que les défenses peuvent être entièrement confiées à des agents autonomes.

La promesse économique passe par les tokens

Microsoft revendique aussi près de 50 % d’économies de tokens par rapport à sa configuration actuelle. Dans un système d’IA, les tokens correspondent aux unités de texte traitées par le modèle. Leur réduction peut diminuer la facture d’inférence, accélérer les traitements et permettre de multiplier les analyses en parallèle.

Cette économie est particulièrement importante en cybersécurité, où les flux sont continus : journaux d’activité, événements réseau, alertes de terminaux et indicateurs de compromission s’accumulent à grande vitesse. Une architecture plus économe pourrait traiter davantage de signaux sans augmenter proportionnellement la consommation de calcul.

La formulation de Microsoft appelle néanmoins une précision. Une baisse de 50 % des tokens ne signifie pas automatiquement une baisse équivalente du coût total. L’infrastructure d’orchestration, la mémoire, les appels à des outils externes et la supervision humaine restent dans l’équation. La performance dépendra aussi du nombre d’agents activés et de la durée des investigations.

L’intérêt du résultat est ailleurs : Microsoft cherche à démontrer qu’une IA de sécurité peut être à la fois plus performante sur un benchmark et moins coûteuse à exploiter. Cette combinaison est indispensable pour passer de la démonstration technique à un usage quotidien.

Project Perception veut rapprocher l’IA de l’action

MDASH et MAI-Cyber-1-Flash doivent alimenter Project Perception, que Microsoft décrit comme une plateforme de sécurité agentique. Le projet vise à transformer l’IA en opérateur capable de relier les signaux, de prioriser les incidents et d’assister les équipes dans leurs décisions.

La préversion publique est prévue le 3 août 2026. Ce rendez-vous sera plus révélateur que le score CyberGym sur plusieurs points : types de sources connectées, droits accordés aux agents, mécanismes d’approbation, traçabilité des actions et possibilité de revenir sur une modification.

Le terme agentique implique une capacité à enchaîner plusieurs étapes et à utiliser des outils, plutôt qu’à produire une simple réponse textuelle. Dans un centre opérationnel de sécurité, cela pourrait réduire le temps consacré aux tâches répétitives : corrélation d’alertes, enrichissement d’un indicateur, rédaction d’un rapport ou vérification d’une configuration.

Mais le niveau d’autonomie sera déterminant. Une plateforme qui recommande une action n’a pas le même profil de risque qu’un système capable d’isoler automatiquement une machine, de modifier une règle réseau ou de désactiver un compte. La valeur opérationnelle dépendra donc autant des garde-fous que de la puissance du modèle.

La course se déplace vers la vitesse d’exécution

Microsoft inscrit cette annonce dans une lecture plus large de la menace : des attaquants peuvent désormais exploiter certaines vulnérabilités à la vitesse des machines, alors que les défenses restent souvent organisées autour d’analystes humains et de procédures successives.

L’argument est solide sur un point. Le délai entre la découverte d’une faille, la publication d’un code d’exploitation et les premières tentatives d’attaque se réduit. Les équipes de sécurité doivent traiter davantage d’événements avec des effectifs qui ne progressent pas au même rythme. L’IA peut alors servir de multiplicateur, à condition de conserver une supervision adaptée aux décisions sensibles.

Le prochain jalon sera donc concret : la préversion de Project Perception devra montrer si le gain annoncé sur CyberGym se traduit par des investigations plus rapides, moins de tickets mal classés et une réduction mesurable du temps de réponse. La bataille entre Microsoft et Mythos ne se jouera pas seulement sur les 12 points d’un benchmark, mais sur la capacité à transformer ces points en minutes gagnées face à une attaque réelle, sans ajouter de nouveaux risques aux systèmes défendus.

Recevez les dernières actualités sur l'IA dans votre boite mail

envelope
Si vous souhaitez recevoir un résumé de l'actualité ainsi que nos derniers guides sur l'IA rejoignez nous !
Actualités Guides Liste IA Prompts Newsletter