OpenAI s’allie à Broadcom pour sa puce d’inférence, Nvidia n’est plus son seul recours
Après avoir consacré des milliards de dollars à l’achat de capacités de calcul, OpenAI s’attaque désormais à la pièce la plus stratégique de cette infrastructure : la puce. Le groupe a annoncé le 24 juin 2026, avec Broadcom, la conception d’un composant dédié à l’inférence des grands modèles de langage, avec un objectif clair : réduire le coût de chaque requête et desserrer l’étau de sa dépendance à Nvidia.
OpenAI veut optimiser l’étape la plus coûteuse de l’IA générative
L’inférence désigne l’exécution d’un modèle déjà entraîné pour produire une réponse à partir d’une requête. À la différence de l’entraînement, qui mobilise des grappes de processeurs pendant de longues périodes, cette phase se répète à chaque question posée à un assistant, chaque image générée ou chaque appel d’API.
À grande échelle, le coût cumulé devient considérable. Chaque interaction mobilise de la mémoire, de la puissance de calcul et des systèmes de refroidissement. Plus les modèles sont volumineux et plus les réponses sont longues, plus la facture augmente. Pour un acteur comme OpenAI, dont les services sont sollicités par des millions d’utilisateurs et d’entreprises, améliorer l’efficacité de l’inférence peut avoir un impact direct sur les coûts d’exploitation.
La puce annoncée avec Broadcom doit être conçue spécifiquement pour cette charge de travail. Contrairement à un composant généraliste, elle pourra être adaptée aux opérations les plus fréquentes des grands modèles de langage : multiplication de matrices, gestion de la mémoire et traitement des séquences de tokens. L’objectif n’est pas nécessairement de remplacer tous les processeurs utilisés par OpenAI, mais de disposer d’un outil mieux ajusté à ses propres modèles et à leur mode d’utilisation.
Une première étape vers une plus grande maîtrise du matériel
Cette annonce marque un changement de position pour OpenAI. Jusqu’ici, l’entreprise s’est principalement appuyée sur les processeurs graphiques de Nvidia et sur les capacités de calcul fournies par ses partenaires du cloud, en particulier Microsoft. Cette stratégie lui a permis d’augmenter rapidement ses capacités sans construire seule l’ensemble de son infrastructure matérielle.
Mais cette dépendance crée plusieurs contraintes. Les accélérateurs de Nvidia sont très demandés, leur disponibilité reste un enjeu industriel et leur prix pèse lourdement sur les budgets des entreprises d’IA. À cela s’ajoutent les coûts associés aux serveurs, au réseau, à l’électricité et au refroidissement. Même avec des revenus importants, les services d’IA générative restent difficiles à rentabiliser lorsque les requêtes nécessitent une puissance de calcul élevée.
Concevoir une puce propriétaire permettrait à OpenAI d’agir sur plusieurs paramètres à la fois : les performances par watt, la quantité de mémoire, la circulation des données entre les composants et l’intégration dans les centres de données. L’entreprise pourrait également ajuster plus rapidement le matériel à l’évolution de ses modèles, au lieu de dépendre uniquement du calendrier des fabricants de processeurs.
Cette démarche ne signifie toutefois pas qu’OpenAI abandonne Nvidia. Le groupe aura probablement besoin d’un portefeuille de composants complémentaires, combinant des accélérateurs généralistes pour l’entraînement et des puces spécialisées pour certains scénarios d’inférence. Une architecture diversifiée peut aussi limiter le risque lié à une rupture d’approvisionnement ou à la hausse des prix d’un fournisseur unique.
Broadcom apporte l’expertise industrielle qui manque à OpenAI
Le partenariat avec Broadcom est déterminant. Concevoir une puce ne consiste pas seulement à définir une architecture adaptée à un modèle d’IA. Il faut aussi la transformer en produit manufacturable, vérifier sa fiabilité, organiser sa production et l’intégrer dans des serveurs capables de fonctionner en continu.
Broadcom dispose d’une expérience importante dans les composants destinés aux centres de données et dans les circuits personnalisés, souvent désignés comme ASIC (Application-Specific Integrated Circuit). Ce type de puce est conçu pour une fonction précise et peut offrir une meilleure efficacité qu’un processeur polyvalent lorsque la charge de travail est stable et suffisamment importante.
Le partenariat répond donc à une logique complémentaire. OpenAI maîtrise les modèles, les usages et les contraintes logicielles. Broadcom apporte les compétences liées à la conception physique, à l’interconnexion des composants et à la fabrication à grande échelle. L’enjeu sera de faire correspondre le comportement des modèles avec les caractéristiques exactes du silicium.
Cette coopération pourrait aussi s’inscrire dans une tendance plus large du secteur. Plusieurs grandes entreprises technologiques développent déjà leurs propres accélérateurs afin de limiter leur exposition aux fournisseurs de processeurs généralistes. Google dispose de ses TPU, Amazon développe ses puces Trainium et Inferentia, tandis que Microsoft travaille sur ses propres composants pour ses centres de données. La maîtrise du matériel devient un moyen de contrôler les coûts et de différencier les services d’IA.
Le vrai test sera industriel, pas seulement technique
L’annonce reste cependant incomplète sur les points les plus concrets. OpenAI et Broadcom n’ont détaillé ni le calendrier industriel, ni les volumes prévus, ni les performances attendues. Aucun chiffre public ne permet donc encore de mesurer l’écart avec les solutions de Nvidia, ou de savoir quand la puce pourra être déployée dans des centres de données opérationnels.
Ces informations seront décisives. Une puce spécialisée n’est avantageuse que si elle peut être produite en quantité, intégrée sans difficulté dans l’infrastructure existante et exploitée par les logiciels d’OpenAI. Les gains théoriques peuvent être réduits par des problèmes de mémoire, de communication entre serveurs ou de compatibilité avec les différentes versions des modèles.
Le calendrier est également un facteur de risque. La conception d’un accélérateur, sa validation et sa mise en production nécessitent plusieurs étapes et peuvent prendre des années. Entre-temps, les modèles d’OpenAI peuvent évoluer, avec des architectures plus longues, davantage de raisonnement ou de nouvelles modalités comme la voix et la vidéo. Une puce optimisée pour une génération de modèles pourrait perdre une partie de son avantage si les usages changent rapidement.
Une bataille pour chaque requête
Pour OpenAI, l’intérêt de cette puce ne se résume pas à une réduction du prix d’achat des processeurs. Il s’agit de reprendre une partie du contrôle sur l’économie de ses services. Chaque amélioration du coût de l’inférence peut se traduire par des marges plus élevées, des abonnements plus compétitifs ou l’accès à des modèles plus puissants sans hausse équivalente de la facture.
Le prochain jalon sera donc mesurable : publication du calendrier de production, annonce des premiers volumes et démonstration de gains précis en coût par requête ou en performance par watt. Sans ces données, le projet reste une orientation stratégique prometteuse plutôt qu’une alternative établie à Nvidia. Mais le signal est déjà net : après avoir acheté massivement du calcul, OpenAI cherche désormais à en contrôler une partie essentielle, jusque dans le silicium.