PandIA

Le meilleur score de DeepSeek R1 grimpe de 5,7× en un an, mais seulement sur MLPerf

Le meilleur score de DeepSeek R1 grimpe de 5,7× en un an, mais seulement sur MLPerf

Le meilleur score par accélérateur pour l’inférence de DeepSeek R1 a été multiplié par 5,7 en un an dans le benchmark MLPerf Inference. Ce bond ne traduit pas une amélioration isolée du modèle : il mesure surtout la vitesse à laquelle progressent les puces, les bibliothèques logicielles et les techniques d’optimisation qui les exploitent.

Un score multiplié par 5,7 en douze mois

Publié le 16 septembre 2026, le benchmark MLPerf Inference v6.1 établit un nouveau record de performance pour l’exécution de DeepSeek R1. Le meilleur résultat obtenu par accélérateur est 5,7 fois supérieur à celui enregistré dans la version v5.1, publiée un an plus tôt.

La comparaison porte sur le meilleur score disponible par accélérateur, et non sur la moyenne des systèmes testés. Elle ne signifie donc pas que n’importe quelle machine exécutera DeepSeek R1 5,7 fois plus vite qu’en 2025. Le résultat reflète la combinaison la plus performante observée dans le protocole MLPerf : matériel, pilotes, compilateurs, bibliothèques d’inférence et réglages logiciels.

Cette nuance ne réduit pas l’importance du chiffre. L’inférence — l’étape durant laquelle un modèle produit une réponse à partir d’une requête — devient un poste de coût central pour les fournisseurs de services d’IA. Une amélioration aussi rapide peut permettre de traiter davantage de requêtes avec une même infrastructure, ou de maintenir un niveau de service équivalent avec moins d’accélérateurs.

Les logiciels comptent autant que les puces

Les gains ne proviennent pas uniquement de la sortie de nouveaux GPU ou accélérateurs spécialisés. Les systèmes d’inférence bénéficient aussi d’optimisations comme la quantification, la compilation des graphes de calcul, la gestion plus fine de la mémoire et le regroupement de requêtes (batching).

Pour un modèle de raisonnement tel que DeepSeek R1, la mémoire et la capacité à maintenir un débit élevé sont particulièrement importantes. Le modèle peut générer de longues séquences de sortie et mobiliser des ressources considérables avant de produire sa réponse finale. Chaque amélioration de la gestion des poids, des activations ou du cache de clés et de valeurs (KV cache) peut donc avoir un effet direct sur le débit ou la latence.

Le benchmark mesure ainsi moins la puissance brute d’une puce que l’efficacité de toute la chaîne d’exécution. Une nouvelle génération de matériel peut apporter davantage de bande passante mémoire, tandis que les logiciels réduisent les temps morts et exploitent mieux les unités de calcul disponibles.

Les modèles vision-langage progressent eux aussi rapidement

La progression ne se limite pas aux modèles de langage. Sur les tâches de modèles vision-langage, le meilleur résultat a augmenté de 2,99 fois en six mois entre les éditions comparées.

Ces modèles doivent traiter plusieurs types de données, généralement des images et du texte. Leur exécution impose des contraintes différentes de celles d’un modèle strictement textuel : prétraitement visuel, projection des représentations dans un espace commun, séquences parfois plus longues et besoins mémoire variables.

Le rythme observé indique que l’optimisation s’étend à des charges de travail plus complexes. Il est également révélateur de la maturité croissante des chaînes d’inférence multimodales, encore moins standardisées que celles des modèles de langage classiques. Là encore, la comparaison concerne les meilleurs résultats du benchmark, pas une accélération uniforme de tous les déploiements vision-langage.

Un record de participation pour MLPerf Inference

L’édition v6.1 a réuni 30 participants et 120 systèmes, un record pour la suite de tests. Cette participation élargie donne davantage de visibilité aux écarts entre architectures et approches logicielles, tout en renforçant la valeur de comparaison du benchmark.

MLPerf, piloté par MLCommons, cherche à établir des mesures reproductibles sur différents scénarios d’utilisation. Les résultats permettent de comparer des configurations soumises à des contraintes communes, plutôt que de se limiter à des annonces de performances fournies par les fabricants eux-mêmes.

La diversité des systèmes est toutefois à interpréter avec prudence. Un résultat publié dans MLPerf dépend du scénario retenu, des exigences de qualité, du niveau de concurrence et des règles applicables à l’inférence. La latence obtenue pour une requête isolée peut différer fortement du débit observé dans un environnement serveur chargé. De même, une configuration optimisée pour maximiser le nombre de requêtes par seconde ne sera pas forcément la plus adaptée à une application interactive exigeant une réponse immédiate.

L’inférence agentique entre dans le périmètre du benchmark

La version v6.1 ajoute également des tests d’inférence agentique. Cette évolution suit une transformation des usages : les systèmes d’IA ne se contentent plus de produire une réponse unique, mais enchaînent plusieurs étapes, interrogent des outils, consultent des sources ou déclenchent des actions.

Dans ce type de scénario, la performance d’un modèle ne se résume pas à la vitesse de génération des jetons. Il faut aussi tenir compte de l’enchaînement des appels, de la coordination entre composants, de la gestion du contexte et des temps d’attente introduits par les outils externes.

L’ajout de ces tests est important car les applications dites agentiques peuvent multiplier les appels à un modèle pour accomplir une seule tâche utilisateur. Une accélération sur chaque étape peut réduire la durée totale d’un workflow, mais l’effet final dépendra aussi du réseau, des bases de données, des API et des règles de sécurité. Le benchmark commence donc à mesurer une réalité plus proche des architectures d’entreprise, sans pour autant reproduire toute leur complexité.

Un potentiel de baisse des coûts, pas une promesse automatique

Un débit multiplié par 5,7 peut, en théorie, réduire le coût d’inférence par requête. Si une infrastructure traite davantage de demandes sans hausse proportionnelle de sa consommation électrique, son amortissement et ses dépenses opérationnelles peuvent être répartis sur un plus grand volume d’usage.

Le calcul réel sera toutefois plus nuancé. Les accélérateurs les plus performants sont souvent coûteux, et leur consommation électrique peut augmenter. Les entreprises doivent aussi financer le stockage, le refroidissement, les interconnexions réseau et les systèmes de supervision. Une amélioration du score MLPerf ne garantit donc pas une baisse équivalente de la facture finale.

Le principal enseignement de cette édition est ailleurs : l’écosystème progresse sur plusieurs fronts à la fois. En un an, le meilleur résultat pour DeepSeek R1 a été multiplié par 5,7 ; en six mois, les charges vision-langage ont progressé de 2,99 fois ; et les scénarios agentiques commencent à être évalués de façon structurée.

La prochaine étape consistera à vérifier si ces gains se retrouvent dans les déploiements réels : temps de réponse observé par les utilisateurs, coût par million de jetons, consommation par requête et capacité à absorber les pics de trafic. C’est sur ces indicateurs, plus que sur le record isolé d’un benchmark, que se mesurera l’impact concret de cette accélération.

Sources : MLCommons — MLPerf Inference v6.1 ; MLCommons — présentation de l’édition v6.1

Recevez les dernières actualités sur l'IA dans votre boite mail

envelope
Si vous souhaitez recevoir un résumé de l'actualité ainsi que nos derniers guides sur l'IA rejoignez nous !
Actualités Guides Liste IA Prompts Newsletter